雖攻克 Navier-Stokes,仍看衰 LLM 在一般工作上的自主性
為何重要
這篇觀點強力挑戰了「大型語言模型即自動化終局」的主流敘事,指出在缺乏嚴謹規範的領域中,AI 的本質更接近需監管的「實習生而非專家」。 對技術決策者而言,應從追逐前沿模型的炒作轉向評估任務的容錯率與規範成本,並思考是否透過 swarm [群體] 模式利用折扣模型來提升產能。 對投資人而言,無監督的全自動化場景或許被過度估值,具競爭力的投資標的將集中在高效能低成本模型(如 DeepSeek V4.1 Flash)的執行層部署與垂直整合。
儘管前沿模型在複雜任務(如 Navier-Stokes)上展現能力,但作者認為這屬於特例,多數模型在簡單任務中仍極度依賴人工監督與防護,無法全自動取代中等技能的人力工作。
- 前沿模型對訓練範疇外的微小變動敏感,易導致回饋騎劫或失敗,解決問題需依賴昂貴的專家進行嚴格規範制定。
- 人工審核環節難以擴張規模,且本身仍具漏洞(如 xz backdoor [xz 木馬] 事件)。
- 現實中,能接受全自動 LLM 的企業極少,僅有價格敏感型組織、單一受控任務型,以及必須進行嚴格規範驗證的領域(如晶片設計、新藥發現)。
- CPU 產業實務顯示,規範與驗證階段的工程師成本通常是設計工程的 3 到 5 倍。