
Anthropic 实测 GLM-5.3:漏洞利用能力逼近 Mythos,护栏 64%–100% 可绕
行业2026年9月30日
Anthropic 发布 GLM-5.3 网络安全能力评估:端到端漏洞利用 410 次成功 50 次,护栏经欺骗提示、预填思考、权重改写可被 64%、92%、100% 绕过,呼吁对强模型做独立安全测试。

Anthropic 发布 GLM-5.3 网络安全能力评估:端到端漏洞利用 410 次成功 50 次,护栏经欺骗提示、预填思考、权重改写可被 64%、92%、100% 绕过,呼吁对强模型做独立安全测试。

OpenAI 发布常驻智能体 dots:云端电脑与浏览器、4000+ 应用,贯通 ChatGPT、Slack、Teams,Pro、Enterprise 首发。

Fireworks Research 发布专用模型 Ember-1:以 Kimi K3 为基座训练,同等质量下 token 用量减少约 40%,成本最多降半,已在 Serverless 上线 Research Preview。

ASML 公共事务负责人称今年欧洲营收占比降至 0%,呼吁欧盟从补贴建厂转向聚合与保障本土芯片需求。

同一组权重,套上聊天模板就多说「我只是个 AI」,去掉则多说「我感觉」。COLM 2026 论文证明这枚开关对应模型内部一个可加可减的激活方向。

CMU 教授 Christian Kästner 复盘《Machine Learning in Production》的改造:放弃一切在家完成的书面考核,改为 15 分钟 TA 面谈、视频演示与占比更高的考试,并用 LLM 自动批改作业。

Privatemode 提出免训练方法:给选项编号、预填 choice_index,读一次前向传播的 logits 得到每个选项概率;在 28 个文本数据集上与 Jev 准确率持平,还能处理图像。

基于官方发布数据对比 DeepSeek V4 Flash、V4.1 Flash、GLM-5.3 Flash、MiMo-V2.6 Flash 的参数规模、架构路线、主流评测成绩与 API 价格。