第一代生成式人工智慧的互動模型很簡單:輸入詞元,輸出詞元。使用者輸入提示,模型處理提示,然後螢幕上顯示回應。大部分可見的工作都發生在推理階段,通常是在雲端GPU上完成的。
這種模式正在改變。
人工智慧代理可以讀取檔案、執行程式碼、使用客戶端應用程式、呼叫工具並完成多步驟任務。在這個新時代,推理仍然至關重要,但生成 Tokens 只是第一步。新的模型是:輸入 Tokens,輸出動作。
從回答問題到完成任務
想想看,問人工智慧助理如何報稅和請代理人幫忙報稅有什麼不同。前者主要是語言問題。後者可能需要代理人開啟文件、提取資料、進行計算、與軟體互動並驗證結果。
這就形成了一個持續循環。模型決定下一步操作,代理呼叫工具,客戶端 CPU 執行操作,並將結果傳回模型。
這些操作大多在使用者的電腦上進行。讀取本機檔案、運行 Python、編譯程式碼、搜尋專案目錄和控制應用程式都嚴重依賴客戶端系統。
因此,智能體的性能不再僅僅取決於模型生成 Tokens 的速度,還取決於電腦將這些 Tokens 轉化為有效工作的速度。
本地CPU將Tokens轉換為動作
推理決定下一步操作,CPU 則負責執行。當智慧體啟動進程、解析檔案、執行指令或協調多個工作進程時,CPU 會處理大部分的執行和排程工作。即使 AI 推理運作在 GPU 或 NPU 上,CPU 仍負責維持整個工作流程的順暢進行。
隨著智能體承擔的任務越來越大,這一點變得特別重要。聊天機器人可能只產生一個回复,而智能體在完成請求之前可能需要執行數十個操作。更高級的系統還可以並行啟動多個子智能體,每個子智能體同時讀取檔案、運行命令並處理結果。
在這些工作負載中,CPU 效能會直接影響工具執行、編譯、本機資料處理、應用程式回應速度以及任務總完成時間。如果每個操作都在等待客戶端回應,那麼即使是快速模型也無法發揮其全部價值。
專為代理工作負載而設計
隨著模型運行速度加快、Tokens 效率提高,本地執行可以佔整個 AI 工作負載的更大比例。
這已經可以透過一個工具密集型的 Codex 開發工作流程來演示,該工作流程運行六個並發的 ChatGPT 5.5 High 代理程式。在測試框架中,每個代理程式都完成了多項任務,包括 AST 和靜態分析、編譯和導入冒煙測試、單元測試、JSON 和 CSV 序列化、SQLite 查詢、壓縮和雜湊、打包和清單操作,以及其他混合本地工具工作負載。此測試框架基於 Python 實作。
在多代理、高負載的開發者 CODEX 工作流程中,搭載 AMD Ryzen™ AI Max+ 處理器的華碩 ProArt 系統 CPU 吞吐量最高可達四年前筆記型電腦的 6 倍。這項結果凸顯了一個重要的轉變:隨著代理程式在本機檔案、應用程式和開發者工具之間執行更多工作,CPU 效能會直接影響任務的整體完成速度。
結論很簡單
隨著人工智慧從生成回應發展到運行應用程式和完成設備上的任務,客戶端硬體成為智慧循環中的積極組成部分。雲端 GPU 可以運行最大的模型。本地 GPU 和 NPU 可以加速私有化和響應式推理,但 CPU 才是提供代理人在這兩種情況下執行所需環境的關鍵。
智能體人工智慧(Agentic AI)提升了 CPU在智能體執行過程中的重要性。無論是在客戶端 PC 或資料中心,CPU 都提供執行環境,將模型輸出轉換為現實世界的行動。 AMD Ryzen AI 和 AMD EPYC 在這過程中各自扮演互補的角色。
歸根究底,衡量人工智慧代理的最重要指標並非其產生 Tokens 的速度,而是其完成任務的速度。網路狀況和雲端推理速度固然會影響體驗,但一旦代理開始讀取檔案、運行程式碼、使用應用程式和協調工具,本地執行時間就成為決定總完成時間的關鍵因素。在智能體時代,客戶端 CPU 的效能決定了智慧轉換為有用工作的速度。
更多COMPUTEX 2026最新資訊就在 ioioTIME 專區中
現在就加入 ioioTIMES 臉書粉絲團 更多互動、更多好康攏抵加!!
我們有LINE TODAY頻道了,快來追踪我們吧!!--最新科技新聞 盡在你手










