關鍵數字:63% 的 Google Gemini 使用者已經習慣用「說」的來跟 AI 互動——不是打字、不是點選,而是像跟真人助理講話一樣開口交代事情。這個數字背後代表的,是整個工作模式的典範轉移。
Google 這次對 Gemini Live 的升級,老實說,比我想像中來得有企圖心。它不再只是個會回答問題的聊天機器人,而是加入了所謂「代理式 AI(Agentic AI)」的能力——白話文來說,就是它開始能「幫你做事」,而不只是「陪你說話」。
而且這次一口氣推出好幾個新功能,從 Spark 多步驟任務、Daily Brief 每日簡報,到 Gmail 語音管理、Personal Intelligence 個人化記憶,每個都在回答同一個問題:既然 63% 的人都開口了,那就讓他們真的用嘴巴把工作做完吧。
📊 數據總覽:語音互動的關鍵數字
先來看看幾個支撐這次升級的核心數據。這些數字不只是參考,它們其實解釋了 Google 為什麼願意把資源投注在語音代理這條路上。
從這張表可以看出來,Google 這次不是小打小鬧的改版,而是有計畫地把語音從「輸入介面」升級成「任務指揮中心」。話說回來,這個 63% 的數字其實也透露了一個訊號:如果將近三分之二的人已經在用語音互動,那剩下的問題不是「要不要做」,而是「能做到什麼程度」。
Spark 來了:語音交辦工作的實際場景
這次升級最有感的,絕對是整合了 Spark 之後的多步驟任務能力。過去我們對語音助理的期待多半停留在「設定鬧鐘」、「查天氣」、「播放音樂」,但 Spark 讓你可以直接對著手機說:
「幫我把這幾週零散記下來的創業點子整理成一份結構化的文件大綱。」
或者像是官方舉的例子——規劃高蛋白素食菜單、根據既有食譜自動生成採買清單。這些任務的共同點是:步驟多、跨應用程式、而且需要背景處理。你不需要一直開著 Gemini App 等它跑完,任務會在幕後持續執行,這點很關鍵,因為它打破了「AI 對話必須即時同步」的限制。
對一般上班族來說,最直接的應用大概是跨網頁與雲端硬碟的資料整理。比如說,你正在研究某個產業的競爭對手,你可以叫 Gemini 去爬公開網頁的資訊、對照你硬碟裡的歷史報表、再把結果寫進一份新的 Google Docs。以前這要手動做一兩個小時的事情,現在用講的可能不到五分鐘。
有趣的是,Spark 目前需要 Google AI Pro(含)以上方案 才能使用。這意味著 Google 把這項最強大的功能放在付費牆後面——我個人覺得這是合理的商業策略,畢竟真正重度使用者本來就有生產力工具預算,而企業端採購更是主要目標。
編輯觀點:從產業面來看,Google 這次的升級其實是在追趕一個趨勢——AI 助理正在從「對話式介面」走向「代理式執行」。但真正有意思的不是技術,而是定價策略。把 Spark 放在 Pro 方案、Daily Brief 放在 Plus 方案,等於是用功能來區隔「一般用戶」和「重度生產力用戶」。我預測接下來半年,微軟 Copilot 和 OpenAI 的 ChatGPT 也會跟進類似的語音代理功能,這三強在企業市場的搶客大戰,會比功能本身更精彩。對一般消費者來說,現階段免費版 Gemini 其實已經夠用,但如果你每週花超過五個小時在重複性的數位整理工作上,那 Pro 方案的投資回報率是算得出來的。
Daily Brief 與 Gmail 管理:早上開口就能掌握全局
再來看看 Daily Brief 這個功能,說真的,我認為它是這次升級裡面「最容易被低估」的一個。每天早上只要問一句 「What’s my daily brief?」,Gemini 就會自動掃過你的 Gmail 和 Google Calendar,用語音整理出今天的待辦事項和重要更新。
這聽起來很簡單,但實際上有兩個細節值得注意。第一,它做的不只是「朗讀」,而是整合與篩選——你可能同時有十五封未讀郵件和三個會議,但它只會挑出真正重要的東西來說。第二,這個功能背後的 Personal Intelligence 機制會記住你過去對話中的偏好,比如你習慣幾點看郵件、哪些類型的通知對你來說比較重要,然後逐步優化呈現方式。
Gmail 的語音管理也同步升級了。現在你可以直接說「幫我把新郵件摘要一下」、「把這封加上星號」、「封存上個月的促銷信」。這些操作雖然不是什麼驚天動地的創新,但組合起來的意義是:你可以在完全不碰手機或電腦的情況下,完成日常郵件整理。開車的時候、準備早餐的時候、甚至剛起床還賴在床上的時候,這些零碎時間突然都變成了「可以工作的時間」。
這裡面有個隱藏的生產力公式,我覺得滿值得拿出來討論:
當然,這些數字是我根據實際使用經驗的粗估,每個人狀況不同,但方向應該沒有太大爭議——語音代理在「資訊整理」這個層級的效率提升是碾壓級的。
Personal Intelligence:它開始「記得」你了
這次還有一個我認為長期影響更大的更新,叫做 Personal Intelligence。簡單來說,Gemini 現在可以記住你過去對話中的資訊,並且串連 Gmail、Google Photos、Google Search 和 YouTube 的內容,提供更個人化的回應。
舉個實際例子。你可以問:「去年夏天去紐約的時候,我們去的那間餐廳叫什麼名字?」或者「幫我找出昨天討論過的那個食譜。」這在過去是不可能的,因為 AI 沒有記憶、沒有個人上下文。但現在它開始有了。
這個功能的挑戰不在技術,在於信任與隱私的平衡。Google 要求使用者先在 Gemini Personal Intelligence 設定中選擇要連結哪些應用程式,這等於是把控制權交還給使用者——你要讓它知道多少,你自己決定。我認為這是正確的設計方向,因為個人化的前提永遠是使用者自主選擇,而不是預設開啟。
從生產力的角度來看,Personal Intelligence 解決了一個很實際的問題:我們的數位足跡太分散了。資訊在 Gmail、行事曆、雲端硬碟、相簿、YouTube 之間各自為政,過去我們要靠自己的記憶去拼湊關聯,現在 AI 可以幫你做這件事情。這不只是方便,它其實是在重新定義「個人助理」這四個字的內涵。
數據告訴我們什麼?
回頭看 63% 這個數字。如果 Google 的調查方法沒有太大偏差,那代表語音互動已經跨越了「嘗鮮者」階段,進入早期大眾市場。而這次 Gemini Live 的升級,本質上是在回應這 63% 使用者的潛在需求——既然你已經願意開口了,那我讓你開口就能做完更多事情。
我對接下來一年的預測是這樣的:
第一,語音代理會成為 AI 助理的標配功能。微軟和 OpenAI 一定會在短期內推出類似產品,這已經不是「要不要做」的問題,而是「什麼時候端出來」的問題。
第二,企業採購會是主要戰場。Spark 放在 Pro 方案不是偶然,Google 很清楚重度使用者(尤其是知識工作者和中小企業主)才是願意付費的核心客群。接下來我們會看到更多針對企業場景的功能,比如團隊協作、權限管理、以及與第三方 SaaS 工具的整合。
第三,語音操作的學習曲線比想像中短。很多人擔心「用講的會不會很不精確」,但實際體驗後你會發現,自然語言的容錯率比打字高得多——你講錯一個字可以馬上修正,但打錯一個字有時候要整段重來。這對非母語使用者來說尤其重要,因為語音可以搭配肢體語言和語調來輔助表達,這是文字永遠做不到的。
最後想給讀者一個具體的建議:如果你已經是 Gemini 使用者,花一個下午把 Personal Intelligence 的設定打開,試著用語音完成一件你平常會手動做的整理工作——不用多,就一件就好。你大概會發現,跟 AI「開口交代事情」的感覺,比想像中自然很多。而這種自然感,才是這整件事最關鍵的變數。
至於那些擔心 AI 會取代工作的朋友,我的看法是:AI 不會取代你,但會用 AI 的人,可能會取代不會用 AI 的人。語音代理只是這條路上的其中一站,而且這站已經到了,該上車了。
本文改寫整理自公開新聞來源,原始報導由自由時報發布。
常見問題 FAQ
Gemini Live 的語音功能需要額外付費嗎?
基本語音對話功能在免費版即可使用,但進階的 Spark 多步驟任務需要 Google AI Pro 以上方案,Daily Brief 則需 Google AI Plus 以上方案,兩者皆為付費訂閱。
Gemini Live 的語音指令支援繁體中文嗎?
目前 Gemini 支援包含繁體中文在內的多種語言,但部分進階功能(如 Spark 複雜任務)的繁體中文理解與執行能力仍在持續優化中,建議實際測試是否符合個人需求。
Personal Intelligence 會存取我的所有 Google 資料嗎?
不會。使用者必須在設定中手動選擇要連結的應用程式(如 Gmail、相簿等),Google 不會預設開啟所有權限,且使用者隨時可以關閉或刪除記憶內容。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。