多智慧體自動研議系統的語彙
為何重要
將模糊的「品味」概念拆解為可量化的「生成式品味」與「評估式品味」,讓研究人員能精準地測試智慧體在何種維度失效。對於開發者而言,這提供了一種結構化的設計語言,能將構想轉化為具體的測試組態。這項工作標準化了評估框架,有助於市場從單純的模型效能競爭,轉向具體的 Multi-Agent 協作系統架構競賽。
本文提出了一套標準化語彙,用於陳述與比較由單一或多個智慧體構建的自動研議系統。該語彙規範了八個核心面向,包括智慧體身份、可用操作、呼叫許可權、通訊方式、資訊可見範圍、行動決策邏輯、系統啟動流程以及輸出評估標準。由於智慧體與初始化可能具備隨機性,系統在相同任務下的執行不會產生單一行為,而會形成軌跡分佈。作者將此語彙套用於近期系統,證實其能涵蓋結構差異極大的設計方案。