AISpot

用 ML Intern 幾天做出 6 個模型,9B 改寫器壓到 0.8B

Hugging Face blog10/7 20:00教學模型開發工具開源

Hugging Face 的 yuvraj sharma 用 HuggingChat 裡的 ML Intern agent,幾天內做出 6 個公開模型,其中把 Qwen-Image 2.1 自帶的 9B 提示改寫器蒸餾成 0.8B 版本,可在 CPU 執行,輸出有效率 99.7%,token 消耗約為教師模型的四分之一。該專案含 9B 模型標註 8,797 條樣本,算力成本 16 美元。

給出了用通用 agent 從零產出可發布模型的完整賬單:9B 教師蒸餾到 CPU 可跑的 0.8B、單項成本僅幾美元,對做小模型蒸餾和在本地跑模型的人有直接參考價值。

原標題:The model that didn't exist, so you made it yourself
閱讀原文

評分80 / 76(平均 78,門檻 65)
狀態精選

相關報導

Hacker News front page● 精選10/7 14:01AI 評分92

Anthropic 發布 Claude Haiku 5.5,執行成本較上代降約 75%

Anthropic 發布 Claude Haiku 5.5,官方稱其是迄今最便宜、最快、能力最強的小模型,平均執行成本比 Haiku 4.5 低約 75%。定價為每百萬 token 輸入 0.10 美元、輸出 0.50 美元(提示 10 萬 token 以內),並首次在 Haiku 級模型上提供可調 effort 設定,用於權衡成本與智慧。

Hacker News front page● 精選10/6 18:17AI 評分86

OpenAI 公開內部前沿模型數學成果與 Lean 形式化證明

OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。

TechCrunch AI● 精選10/6 10:33AI 評分90

Mistral 發布 1T 引數多模態模型 Mistral Large 4

法國 AI 實驗室 Mistral 於週二發布 1 萬億引數多模態模型 Mistral Large 4(ML4),暱稱 Le Chonk。它暫不是開放權重模型,只能通過公開的 guardrail 端點訪問,Mistral 計劃三週內完成安全測試後放出權重。該模型全程用自家算力訓練,僅 4000 塊 Nvidia GPU,官方稱比中國競爭對手少兩到三倍。基準結果未公布,最佳化場景包括網路安全、金融和晶片設計;三星上月以 210 億歐元估值領投其 D 輪。