Inherent AI 助手 Faraday 超越 Anthropic 与 OpenAI 论文复现能力
伦敦 AI 实验室 Inherent 推出的 Faraday 代理模型,以更小的体量在独立复现已发表科研论文上击败 Anthropic Claude Opus 4.8 与 OpenAI GPT‑5.5,展示了其在科研自动化方面的潜力,预示着 AI 将从验证走向发现新知。
背景:AI 进入科研复现的赛道
在人工智能快速渗透科研领域的今天,能够自动复现已发表论文的模型被视为衡量科研辅助能力的重要标尺。复现不仅是验证实验可靠性的基本步骤,也是新研究者熟悉领域的必经环节。近期,伦敦 AI 实验室 Inherent 公开的 AI 代理 Faraday,凭借“更小体量、更多灵活”的设计,在这一任务上实现了对 Anthropic Claude Opus 4.8 与 OpenAI GPT‑5.5 两大主流大模型的超越。
Inherent 与 Faraday 的核心优势
Inherent 由前 Google DeepMind 成员创立,团队在强化学习与大模型压缩方面拥有深厚积累。Faraday 之所以能够在复现任务中脱颖而出,归功于以下几个技术突破:
- 任务导向的微调策略:团队采用了“科研任务链”方式,将论文的实验设计、数据处理、结果分析等环节拆解为可编程子任务,使模型在每一步都能得到针对性反馈。
- 高效的参数稀疏化:相比传统的大模型,Faraday 通过结构化稀疏化将参数规模压缩至原模型的 30% 以下,却保持了关键推理能力。
- 跨模态信息整合:模型能够同时读取文本、表格和图像等多种论文附带材料,实现对实验细节的全方位理解。
实验结果:超越大模型的具体表现
Inherent 在公开的基准测试中,让 Faraday 独立复现了 50 篇自然科学与计算机科学领域的论文。评估标准包括实验步骤完整性、数值误差范围以及结果可重复性。结果显示:
- Faraday 在复现成功率上达到 84%,高于 Claude Opus 4.8 的 71% 与 GPT‑5.5 的 78%。
- 在数值误差控制方面,Faraday 的平均偏差仅为 2.3%,显著低于对手模型的 4.9%。
- 复现所需的计算资源仅为对手模型的约 35%,体现了其高效的算力利用率。
这些数据表明,模型规模并非唯一决定科研任务表现的因素,算法与训练方法的创新同样关键。
意义与未来展望
Faraday 的成功为 AI 在科研领域的进一步渗透提供了有力证据。首先,它展示了“小而精”模型在特定垂直任务上可以超越通用大模型,这为资源受限的实验室提供了可行的技术路径。其次,复现能力的提升意味着 AI 将能够在文献调研阶段自动筛选可靠实验,帮助研究者快速定位创新点。Inherent 计划在此基础上拓展至“发现新规律”阶段,即让模型在已有数据的基础上提出假设并设计实验验证。
不过,仍需关注模型在跨学科、数据稀缺领域的适应性,以及对科研伦理的潜在影响。未来,随着更多科研机构与 AI 初创公司合作,类似 Faraday 的专用代理或将成为科研工作流的标准组件,推动科学发现进入更高效、自动化的时代。