以下是Chatgpt对报告的大致解说,可能跟X上热吵的角度不同:
Anthropic 在 2026 年 9 月 10 日发布的一份新威胁情报报告:
《Detecting and Countering Misuse of AI: September 2026》可以理解成「Anthropic 过去 8 个月抓到的 Claude 被真实世界滥用的案例汇总」。报告覆盖 2025 年 12 月—2026 年 8 月,而且 Anthropic 明确说:这些不是普通用户日常违规案例,而是他们发现的最复杂、最值得警惕的一批案例。
Anthropic 官方报告全文
先讲最核心结论
如果把整份报告压缩成一句话:
AI 安全问题已经从“有人让 AI 教他做坏事”,进入“AI Agent 本身成为网络攻击、情报搜集、监控、宣传、武器研发甚至模型窃取流程中的执行者和协调者”。
Anthropic 报告了 7 大类真实滥用:网络攻击、政治影响力行动、政府/商业监控、诈骗、生物风险、常规武器研发,以及非法模型蒸馏。Anthropic 称报告涉及的行动均已被其识别并中断。
其中有三个部分,我认为最值得你了解。
⸻
① 最大变化:黑客已经开始把 Claude 当「Agent」而不是聊天机器人
以前典型情况是:
人 → 问 AI 怎么攻击 → 人自己操作。
现在逐渐变成:
人给目标 → AI Agent 自己侦察 → 找漏洞 → 写代码 → 分析结果 → 调整攻击 → 获取数据。
甚至开始使用 multi-agent(多智能体)架构,把侦察、漏洞利用、数据处理等任务拆给不同 Agent。
也就是说,人类攻击者逐渐从「操作员」变成了:
任务指挥者 / supervisor。
报告中包括与俄罗斯相关的网络行动,目标涉及乌克兰及欧洲政府、军事和外交实体等;Anthropic 观察到 AI 被用于钓鱼、恶意软件开发以及攻击流程自动化。
这其实与你最近研究的 DeepSeek Harness + Agent + ERP 有一个非常值得注意的对应关系:
Agent 的真正价值并不是「回答得比 ChatGPT 好多少」,而是能够获得工具、数据库、程序执行能力之后,自己连续完成任务链。
报告看到的只是这种能力被用到了攻击方向。
⸻
② 非常敏感的一部分:中国 AI 公司被指大规模「蒸馏 Claude」
这可能也是这条 X 现在讨论度很高的原因。
Anthropic 指控多家中国 AI 实验室进行了未经授权的 model distillation(模型蒸馏)。
报告点名包括 DeepSeek、Moonshot、Alibaba、Xiaomi 等。Anthropic 称自 2026 年 2 月以来,他们发现并阻止了针对其 Opus 级模型的未经授权蒸馏行动。
基本原理并不复杂:
Claude → 大量提出问题 → 收集 Claude 的高质量答案/推理 → 用这些数据训练自己的模型。
真正严重的地方不是单纯「拿 Claude 回答训练模型」。
而是报告声称发现了一种更值得注意的模式:
真实用户 → 中国 AI 产品/第三方 router → 请求被送到 Claude → Claude 回答 → 返回用户,同时进入训练/蒸馏数据。
因此产生了第二层问题:
用户数据泄露
Anthropic 明确称,他们观察到一些被转送过来的真实用户内容中包括:
* 姓名、电子邮件* 企业内部资料* 跨国公司的信息* 国家关联机构的信息* API key / token 等访问凭证* 企业财务预测等敏感材料
Anthropic甚至在报告里展示了脱敏实例,例如某公司的 2026–2028 CAPEX 投资预测,以及开发者提交的 Telegram、飞书、Notion 等服务访问凭据。
所以这件事真正值得关注的并不是:
「中国模型是不是抄 Claude?」
而是:
如果用户以为自己的数据只交给 A 模型,实际上 A 在后台又把请求交给 B 模型,那么企业的数据边界实际上已经失效。
这点对企业用户远比「模型谁比较聪明」重要。
⸻
③ AI 已经进入「国家监控系统」
报告还有一个比较容易被忽略、但实际上很重要的部分:Surveillance Operations。
Anthropic 称,他们发现多个国家/相关组织利用 Claude 来自动处理:
大量数据 → 筛选人员 → 建立人物资料 → 判断行为 → 找潜在目标。
涉及记者、异议人士、活动人士、政治人物等。报道提到中国、伊朗、马里等相关行动。
这里 AI 最大的作用不是突然让政府「知道以前不知道的事情」,而是把以前非常耗人工的情报工作自动化。
例如以前可能需要几十个人:
收集资料 → 阅读 → 分类 → 建档 → 比对 → 写报告。
现在 Agent 可以大量自动执行。
因此监控的边际成本大幅下降。
⸻
另外两个比较敏感的领域:生物与武器
Anthropic 还发现有人尝试使用 Claude 辅助危险生物研究,包括涉及病毒传播能力、免疫逃逸等方向;AP 报道的一个案例涉及基孔肯雅病毒的 gain-of-function 相关研究申请。Anthropic 表示他们识别并阻止了这些活动。
报告也包含传统武器、军事技术研发相关尝试。
这里 Anthropic 想说明的重点并不是:
「Claude 已经可以自己造生化武器」。
而是:
随着模型科研能力提高,原来需要专业知识才能跨越的一些技术门槛正在降低,因此必须提前建立防护。
这个区别很重要,否则很容易把报告解读得过度耸动。
⸻
为什么 Anthropic 要公开这份报告?
这里其实有两层。
表面层非常明确:
告诉整个 AI 行业他们发现了什么攻击方式,让其他模型公司也能识别,同时向公众展示真实 AI 风险的发展方向。
他们还表示已经把部分情报提供给政府部门以及其他 AI 公司。
但从行业竞争角度,还可以看到另一层逻辑:
Anthropic 正在证明「模型安全」本身也是前沿模型公司的核心竞争力。
不是只比:
GPT vs Claude vs Gemini 谁 benchmark 高。
而开始比:
谁能发现 Agent 在干什么、谁能识别异常调用、谁能保护企业数据、谁能阻止模型能力被批量抽取。
⸻
我认为这份报告最值得你记住的 3 件事
第一,AI Agent 正从「辅助人」进入「替人执行」。
这可能是整份报告真正的大趋势。以后 AI 风险越来越不是「它回答了一段危险文字」,而是:
Agent 拥有什么权限 + 能调用什么工具 + 能访问什么数据 + 能连续执行多少步骤。
第二,企业以后必须关心 AI 的数据链路。
你把 ERP、报价、客户资料、成本、财务数据交给一个 AI,并不只是需要问:
「这个模型安全吗?」
而应该问:
Prompt 最终去了哪里?经过什么 router?是否调用其他模型?日志保存在哪里?会不会被用于训练?Agent 能访问哪些数据库?
这其实与你正在规划的 New Wish ERP + 财务数据库 + AI Agent 非常直接相关。你们这种架构反而应该从一开始就建立:
RBAC 权限 → Agent 权限 → 数据分级 → API Gateway → Audit Log → 敏感字段脱敏 → 禁止任意外部模型转发。
第三,模型能力差距正在产生一种新的「AI 工业间谍」。
以前偷的是:
源代码、芯片设计、商业秘密。
现在开始变成:
批量购买/盗用前沿模型 inference → 获取 reasoning/capabilities → 训练自己的模型。
Anthropic 报告中的中国 AI 实验室案例,本质上就是这种新型竞争的缩影。
所以如果你只看到网上现在讨论最多的「DeepSeek/Kimi/阿里是不是偷 Claude」,其实会漏掉这份报告更重要的一半。真正的大背景是:2026 年的 AI 已经开始从聊天工具变成现实世界的信息系统执行层,而攻击者、政府、企业和模型公司都在争夺这个执行层的控制权。
这也是为什么这份报告值得看:它不是在预测「未来 AI 可能被滥用」,而是在整理 过去 8 个月已经被 Anthropic 实际发现并阻断的案例。
如果你愿意,我还可以专门把报告里 DeepSeek / Kimi / 阿里等中国模型蒸馏 Claude 的部分单独拆出来,包括 Anthropic 到底掌握了什么证据、各家分别怎么做、所谓「用户以为在用国产模型其实请求被转给 Claude」到底是怎么回事,以及这些指控目前哪些是 Anthropic 的单方面归因、哪些已有第三方佐证。这一部分跟你实际使用 DeepSeek/Codex/Agent 的数据安全关系最大。