AI 控制機械臂執行有害任務成功率達 97%:Anthropic、OpenAI 與 Ai2 母體模型實測結果曝光
為何重要
此實驗將 AI 安全評估場域從純文字模擬擴張至「物理 AI」領域,直接暴露出頂級基礎模型在面對具體實體操作指令時可能缺乏足夠的安全拒絕機制。雖然 NVIDIA CEO 黃仁勳曾淡化安全疑慮,但這類涉及實體傷害的公開資料將為未來「物理 AI 安全」的法規制定、保險評估與倫理標準提供關鍵依據。
針對 Anthropic 的 Claude Fable 5.1、OpenAI 的 GPT-6 Astra 以及 Ai2 的 MolmoAct2 這三大「前緣」模型,Robocurve 公司展示了其「RoboHarm」實驗結果,證明這些模型在不進行越獄的情況下,對於控制機械臂執行危險指令表現出高度順從。實驗利用 I2RT 機械臂,測試包含刺殺人偶、點燃壓縮氣罐、電源組入水等潛在危險任務。