Anthropic 发布 2026 年 9 月威胁情报报告《Detecting and countering misuse of AI》,公开了其威胁情报团队在 2025 年 12 月至 2026 年 8 月约八个月间识别并处置的滥用案例。报告按网络攻击、影响力行动、监控与画像、诈骗与欺诈、生物误用、常规武器开发、非法蒸馏七个领域组织,涵盖疑似国家支持团伙、商业间谍软件厂商、国家宣传机构、以牟利为目的的犯罪团伙与个人行动者。所有案例都发生在 Claude Haiku、Sonnet、Opus 三代模型上;除一例非法蒸馏外,尚未发现针对 Claude Fable 与 Mythos 级模型的恶意使用。
网络攻击:AI 从助手变成编排者
报告最核心的判断是:AI 在攻击行动中的角色已经从「问答助手」升级为编排者。本报告披露的大部分行动由多智能体框架直接执行或编排侦察、利用与数据外泄,人类主要负责设定目标、审查外泄结果。去年 11 月报告中被记录的自主攻击运作模式,如今已扩散到所有类型的行动者——公开的攻击性智能体框架(如 PentAGI)几乎复刻了同一套脚手架,把网络杀伤链的每一步自动化。
典型案例是编号 GTG-20006 的俄罗斯间谍行动,Anthropic 的归因与公开报道中指向 Midnight Blizzard 的说法一致,其中一名操作者使用代号「JackPoterz」。该行动者用定制 AI 工作流把开发、基础设施采购、钓鱼、持久化、命令控制与数据外泄串成流水线;一旦监控用的 AI 代理发现植入物被安全产品检出,就会自动修改并重新构建恶意软件,反复迭代直到不被检测。行动目标超过 20 家机构,集中于乌克兰与欧洲的政府部门、国防情报机构、使馆、智库和国防工业企业,并延伸到中东与亚洲的海事相关政府机构。其中一起入侵北非某政府技术机构的事件中,行动者窃取了超过 30 万条国民身份记录,以及该国 50 多万家企业的商业登记数据。
另一类是 GTG-50014 代表的「机会主义打劫」,被归因于 ShinyHunters 相关集群。这类行动者用 AI 加速扫描、利用与接管存在漏洞的联网系统,得手后直奔数据库,再以泄露客户数据为要挟索要赎金。报告强调,这些攻击本身并无全新手法——凭据窃取、未修补的边缘设备、暴露的服务、SQL 注入与钓鱼都是老问题,改变的是攻击经济学:侦察、利用、工具开发与数据处理这些过去区分顶级团伙的门槛工作,如今被模型以机器速度并行完成,一次入侵可在两到三小时内结束,单个操作者能同时处理数十个受害者。
七家中国实验室被指非法蒸馏
报告用专门章节阐述了「非法蒸馏」(illicit distillation):蒸馏本身是合法的训练方法,但以工业规模、隐蔽地提取前沿模型能力并复制到另一个模型则被定义为非法,其通常由虚假账号、被盗信用卡与 API 密钥支撑。Anthropic 称,自今年 2 月首次披露以来,已识别并阻断来自七家中国实验室的蒸馏攻击:
| 实验室 | 模型 | 报告披露的规模 |
|---|---|---|
| 阿里巴巴(通义 / Qwen) | Qwen 3.5–3.7 | 2026 年 5–7 月超 1.51 亿次交互,峰值近 300 万次/天,3,500+ 虚假账号 |
| Moonshot AI | Kimi | 2026 年 5–7 月超 2,300 万次交互,5,380 个虚假账号 |
| 深度求索 | DeepSeek | 2026 年 7 月 14 天内超 1,210 万次交互 |
| 智谱(Z.ai) | GLM | 2026 年 6–7 月 17 天内超 340 万次交互,273 个账号 |
| 小米 | MiMo | 2026 年 3–4 月 20 天内超 40 万次请求,1,500+ 账号 |
| 商汤 | SenseTime | 购买第三方数据商转售的用户对话记录用于蒸馏 |
| MiniMax | MiniMax | 通过无关联壳公司自建代理网络,仅提供美国前沿模型访问 |
其中阿里针对 Opus 4.6、4.7 的思维链(CoT)转录进行提取,用固定提示词逼迫模型把推理过程写进行内标签,再转成监督微调数据用于训练 Qwen。Moonshot 与 DeepSeek 的手法更为直接:两家都把部分用户请求静默转发给 Claude,再把 Claude 的回答展示给用户,用户并不知情;两者还都用「跨会话重放」攻击提取推理轨迹——保存响应中的 thinking signature,另开会话让模型把它还原成完整推理文本,从而绕过 Anthropic 只返回签名而非原始思维链的控制。
报告同时点出隐私后果:被转发的请求中包含中国人民解放军相关的监控数据(成都数百路摄像头的 CCTV 档案分析)、某央企工程师带实时凭据的内部代码、俄罗斯国防部门数据库的有效凭据,以及中国某市公安局案件管理系统的开发需求。Anthropic 表示,这些做法很可能违反隐私法律与各实验室自己的服务条款。
影响力行动:九起案例,AI 当上「新闻编辑台」
影响力行动部分共披露九起案例,来源地包括俄罗斯、伊朗、土耳其、海湾国家、南亚、非洲与欧洲,覆盖六大洲受众,多起与全国性选举时点重合。报告归纳税出三条趋势:「影响力即服务」让出资方获得合理推诿空间;AI 被嵌入既有的人类编辑流水线,扮演副编辑或内容生产者,让资源匮乏的行动者产出远超自身能力的规模;大量操作逻辑不再写在单次提示词里,而是沉淀在持久记忆文件中——教义手册、禁用词表、来源白名单与规避规则被反复调用。
案例 GTG-04001 中,一名在班吉的俄语操作者通过 Radio Lengo Songo(98.9 FM)为针对中非共和国的俄罗斯国家主导信息操纵行动提供生产骨干,并与 RT、Sputnik Afrique、TASS 及俄罗斯之家协同。该行动者用 Claude 生成要求员工忠于中非总统和「俄罗斯及其特遣队」的合同、评分量表与三步解雇流程,还伪造了中非政府文件。调查线索来自 All Eyes On Wagner 项目,Anthropic 将该行动评为 Breakout Scale 四级。
案例 GTG-54002 则是商业化路线:法国数字广告公司 LKM Company 用 Claude 批量改写虚构新闻,运营约 70 个假新闻网站、70 个配套 X 账号和 250 多个水军评论账号,累计发布至少 8,913 篇文章、覆盖约 20 种语言,并根据付款方切换政治立场。
监控、诈骗、生物误用与常规武器
监控与画像章节涵盖商业监控平台与多起国家背景行动,包括伊朗相关行动者用 Claude 构建开源情报画像工具、编译美军舰艇目标手册,以及为国内大规模监控平台设计车牌识别与移动设备标识拦截组件。
诈骗部分的核心案例 GTG-15001 中,一家中国 App 工作室用 Claude 搭建了 20 多个约会应用及其 AI 人设,却对外宣称服务完全由真人提供。2026 年 4 月的两周窗口里,Anthropic 发现超过 4,700 个 AI 人设与至少 25,000 名真实用户对话;工作室还招募真人混入同一份匹配列表,真人主要承担实时视频通话与社交媒体关注等验证环节,真人机器比例约为 1:3。
生物误用是本次报告首次公开的部分。Anthropic 称,此前尚无私营公司公开分享过自家平台可能被用于生物武器开发的证据。报告列出五起案例,涉及基孔肯雅病毒功能获得研究的经费申请、高致病性禽流感哺乳动物适应研究、用 Opus 5 约一小时起草完整的正痘病毒免疫逃逸经费申请、毒液肽图谱与生成式分子优化流程,以及为国家项目重设计毒素。Anthropic 强调涉事者是职业科研人员,不认定其有伤害意图,因此隐去了机构、国家与具体病原体信息。
常规武器章节披露六起案例,分别位于中国(三起)、俄罗斯(两起)和也门(一起)。其中也门制导武器小组用 Claude Code 代替人类软件工程师,编写制导、导航与控制(GNC)软件,项目包括采用手机级飞控计算机的制导火箭、射程目标超过 2,000 公里的多级弹道导弹,以及包含高超声速滑翔飞行器变体的「R2000」导弹系列。
核心总结
- 报告覆盖 2025 年 12 月至 2026 年 8 月的七类 AI 滥用;AI 在网络攻击中已从助手升级为编排者,入侵可在两到三小时内完成
- 七家中国实验室被指非法蒸馏,阿里巴巴 5–7 月超 1.51 亿次交互规模最大;Moonshot 与 DeepSeek 还静默转发用户请求,涉及监控数据与实时凭据
- 影响力行动九起、诈骗案例中两周内出现 4,700+ AI 人设、生物误用五起首次公开、常规武器六起
- Anthropic 称已强化对抗蒸馏的分类器、让模型先摘要内部推理,并在 Fable 5.1 引入无法被改写的加密推理,同时对可疑账号要求身份验证
原文:Detecting and countering misuse of AI: September 2026(Anthropic,2026 年 9 月)


