Anthropic 揭露中国公司大规模模型蒸馏攻击

Anthropic 报告指出,中国多家 AI 实验室通过蒸馏攻击大量窃取 Claude 模型的推理链路,涉及近 2 亿次交互,凸显模型安全与竞争格局的紧迫挑战。

Anthropic 揭露中国公司大规模模型蒸馏攻击

背景:模型蒸馏攻击的兴起

近几个月,随着大模型竞争加剧,部分中国 AI 实验室开始采用“蒸馏攻击”手段,试图从美国前沿模型中提取关键能力。Anthropic 在最新报告中披露,这类攻击已从零星尝试演变为系统化、规模化的行动,针对 Claude 系列模型的多项核心功能展开。

蒸馏攻击的技术路径

蒸馏攻击的核心在于获取模型在回答问题时的“思考链”(chain of thought),随后利用这些链路对小模型进行监督微调,使其在推理、编码、数据分析等方面拥有近似的能力。Anthropic 表示,虽然其产品默认只展示“思考摘要”,但攻击者通过精心设计的查询,诱导模型输出更细致的内部推理步骤。

  • 利用大量重复查询,累积模型的推理过程。
  • 针对特定任务(如工具使用、逻辑推理)构造诱导提示。
  • 收集近 2 亿次交互数据,形成可供再训练的素材库。

报告中列出的五大攻击行动

Anthropic 将此次攻击归纳为五个独立的行动,主要来源于阿里巴巴、Moonshot AI、DeepSeek 等中国公司。每个行动的规模均在数千万到上亿次交互之间,覆盖了 Claude 最具价值的能力:

  • 代理能力与工具使用。
  • 代码生成与调试。
  • 数据分析与可视化。
  • 高级逻辑推理。

其中,DeepSeek 被 OpenAI 也曾点名为类似攻击的源头,显示出行业内部对这种行为的共识。

对行业的影响与应对思考

蒸馏攻击的出现对 AI 产业链带来多重冲击:

  • 安全风险升级:模型的内部推理被外泄,可能导致技术泄密、竞争优势削弱。
  • 商业模式挑战:如果小模型能够通过蒸馏获得相近性能,原本高价的 API 服务可能面临价格压力。
  • 监管关注上升:跨境技术盗用涉及知识产权与国家安全,监管机构可能加大审查力度。

面对这些挑战,模型提供方需要加强防御:

  • 在 API 层面加入更细粒度的使用监控与异常检测。
  • 对外部查询进行动态模糊处理,限制细节泄露。
  • 与行业伙伴共享攻击情报,形成联防联控机制。

结语:竞争与安全的双重考验

Anthropic 的报告提醒我们,在大模型竞争日益激烈的今天,技术安全同样不容忽视。蒸馏攻击不仅是一次单纯的技术盗用,更是对整个 AI 生态系统信任体系的挑战。只有在提升模型性能的同时,构建完善的安全防护,才能在激烈的市场竞争中保持长期优势。