Are AI Labs Pelicanmaxxing?
為何重要
此研究以嚴謹的統計分析(固定效應回歸)檢驗了 AI 行業最著名的「梗測試」之一,揭示了即便在熱門的非正式 benchmark 上,企業也未必會進行過度調校。對於關注模型訓練邊際效益與策略的技術決策者而言,這是一個證明「討論聲量不等於實際投入」的典型案例。
- 實驗設計:作者將 Simon Willison 的「鵜鶘騎腳踏車」提示詞擴充,測試前 7 名 AI 模型生成 8 種動物(含 pelican)× 6 種車輛(含 bicycle)共 48 組的組合能力的情況,總共產出 1,008 張 SVG 影像。
- 評量框架:透過三階段管線評估影像品質,包括將 SVG 渲染為 PNG(僅 11 次 Regeneration)、由 GPT-5.6 Luna 以 1-5 分評鑑動物、交通工具與一致性,並輔以 Gemini 3.1 Flash-Lite 進行影像特徵提取。
- 核心資料:統計結果顯示,pelican 排名第 6 名(8 個動物中),bicycle 排名墊底,且「pelican-bicycle」這項特定組合發生在第 42 名(超過 48 個組合)。模型間並未顯示出為該 benchmark 最佳化的顯著跡象(統計顯著性未達標)。
- 結論傾向:沒有強烈證據支援 AI 實驗室針對此「benchmaxxing」進行了專門調整或強化。