ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Hunyuan-A13B 技術報告

模型 1 個來源 · 1 小時前
為何重要

該模型證實了 MoE 架構在平衡運算成本與模型效能上的有效性,專注於資料工程治理(如 STEM 增強)與推理最佳化(CoT 混合模式),有助於縮小開源專案與閉源頂級模型之間的效能差距。對於開發者而言,這提供了一個適合延遲敏感應用的高吞吐量選擇;對於產業而言,顯示出資料品質與訓練策略在模型競爭中的關鍵性。

Hunyuan-A13B 是一個基於 MoE 架構的開源大型語言模型,旨在透過精簡的引數數量達到高效能。研發團隊透過加強 STEM 資料的篩選與審核,提升了模型在科學領域的事實可靠度與推理能力。透過結合監督式微調和強化學習,模型在多項任務中展現了逼近大型模型的競爭力。- 採用 MoE 架構,總引數為 80B,但推理時僅啟動 13B 引數。 - 訓練語料庫規模達 20T token,並針對 STEM 資料進行了增強策展。 - 引入雙重模式 Chain-of-Thought 框架,可依任務複雜度切換思考速度。 - 已公開發布,目標是支援開源研究與實務 LLM 部署。

HunyuanA13BMoEOpen Source LLMChain-of-Thought

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00