Faraday是什麼
Faraday 是倫敦 AI 實驗室 Inherent 推出的 AI 科學家智能體,基於 270 億參數的 Qwen 3.6 模型,通過強化學習訓練而成。Faraday能像人類博士生一樣,在不預先知道答案的情況下,自主閱讀論文、設計實驗並復現研究結果。Faraday 在論文復現基準 Replica 上表現超越 Claude Opus 4.8 和 GPT-5.5。

Faraday的主要功能
- 自主論文復現:閱讀被遮蓋結果圖表的學術論文,推斷實驗方法,在 60 分鐘 + 有限 GPU 資源內自主設計並執行復現實驗
- 科學實驗設計:面對無法全規模復現的實驗,能按比例縮小但仍忠實於原論文核心主張,展現”研究品味”
- 工具調用編程:將 Codex GPT-5.5 作爲外部編碼工具,自己負責科學決策,代碼執行交給專業編程 agent
- 跨領域泛化:訓練於 ML 論文,測試於 AI-for-Science 論文,具備跨領域遷移能力
Faraday的技術原理
- 基座模型選擇:Faraday 基於 Qwen 3.6-27B 構建,僅 270 億參數,團隊通過強化學習後訓練賦予其科學決策能力,將代碼實現交由外部工具完成,驗證科學智能與工程智能可以解耦。
- Coding Agent as a Tool (CAT) 架構:Faraday 通過 shell 工具調用 Codex GPT-5.5 作爲外部編程助手;Faraday 專注高層科學決策,包括理解論文、設計實驗方案和分配計算資源,由 Codex 負責具體的代碼編寫與調試執行。
- Replica 任務空間:訓練數據來自自動生成的 Replica 基準,涵蓋 100 篇 1990–2026 年的知名論文共 310 個復現任務;用 Gemini 2.5 Pro 自動識別並遮蓋論文中的結果圖表形成任務,Agent 需在 60 分鐘和 1/7 個 H200 GPU 的嚴格限制內自主復現本。
- Rubric-based Judge 獎勵系統:針對復現任務無確定答案的難題,系統先用 Claude Opus 4.7 爲每個任務自動生成專屬評分標準(隱藏原始 gold plot 以防過擬合),再由 Codex GPT-5.5 作爲執行 judge,在 10 分鐘內審查代碼庫、git 歷史和交互記錄,從視覺匹配、科學主張支持、實驗忠實度、資源利用效率和科學誠信五個維度給出 0–1 分的獎勵信號。
- 長程強化學習訓練:Faraday 採用修改版 GRPO 算法配合 LoRA 微調(rank=128),在 128K token 上下文窗口中以 6×10⁻⁶ 學習率進行後訓練;每批次均勻採樣覆蓋不同時代的論文,確保訓練不受單一科學範式主導,實現穩定的長程非可驗證任務優化。
如何使用Faraday
Faraday 目前處於研究發佈階段,尚未推出面向公衆的 API、產品界面或體驗入口。
Faraday的核心優勢
- 小模型大能力:基於 270 億參數的 Qwen 3.6,在論文復現任務上超越 Claude Opus 4.8 和 GPT-5.5,證明科學智能無需依賴超大規模模型。
- 工具解耦架構:採用 Coding Agent as Tool (CAT) 範式,Faraday 專注科學決策,將代碼實現交由 Codex GPT-5.5 完成,實現科學智能與工程智能的高效分工。
- 研究品味培養:通過強化學習習得”研究品味”,在資源受限時仍能設計忠實於原論文的縮小版實驗,拒絕硬編碼和作弊捷徑。
- 跨領域泛化:在 ML 論文上訓練,在 AI-for-Science 論文上測試仍保持 60% 以上任務勝率,展現強大的跨領域遷移能力。
- 可擴展基準:基於 Replica 自動生成任務空間,從 100 篇論文擴展出 310 個復現任務,爲 AI 科學家訓練提供可規模化的數據基礎。
- 穩定長程 RL
成功將 GRPO 強化學習擴展到長程、非可驗證的科研任務,通過 per-task rubric judge 和 turn-level credit assignment 實現穩定訓練。
Faraday的項目地址
- 項目官網:https://inherentlabs.ai/research/training-to-replicate
- arXiv技術論文:https://arxiv.org/pdf/2608.13331
Faraday的同類競品對比
| 對比維度 | Faraday (Inherent) | The AI Scientist (Sakana AI) |
|---|---|---|
| 核心定位 | 專注”論文復現”,驗證已有研究結果的可靠性 | 端到端自主科研——從假設生成到論文撰寫的全流程 |
| 基座模型 | Qwen 3.6-27B(小模型+外部工具) | 調用 Claude/GPT 等前沿模型作爲基礎 |
| 工作方式 | 像人類博士生一樣復現論文圖表,使用 Codex 作爲編程工具 | 自主提出研究想法、運行實驗、撰寫 LaTeX 論文 |
| 任務範圍 | 復現已發表論文中的特定結果圖表(Replica 基準) | 從零開始生成完整研究課題併產出可投稿論文 |
| 驗證方式 | 自動 Rubric-based Judge + 人類專家評估復現質量 | 通過真實學術會議(ICLR Workshop)同行評審驗證 |
| 開源情況 | 論文與 Replica 基準已公開,模型未開源 | AI Scientist v1/v2 代碼已在 GitHub 開源 |
Faraday的應用場景
-
學術論文復現驗證:科研機構可用 Faraday 批量驗證已發表論文的可復現性,解決機器學習領域的”復現危機”。
-
博士生科研訓練:作爲”虛擬研究助手”,幫助博士生通過復現經典論文來培養實驗設計與科學品味。
-
AI-for-Science 實驗驗證:在材料科學、氣象預測、生物信息學等領域,自動復現跨學科論文中的實驗結果。
-
研究基準測試:爲 AI 科學家 Agent 提供標準化的 Replica 評估框架,用於衡量不同模型在科研任務上的能力。
-
研究方法審計:期刊審稿人或基金評審機構可用 Faraday 快速檢驗投稿論文中實驗結果的真實性與可復現性。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...