
OpenAI 发布 dots:由 GPT-6 Astra 驱动的常驻云端智能体
OpenAI 发布常驻智能体 dots:云端电脑与浏览器、4000+ 应用,贯通 ChatGPT、Slack、Teams,Pro、Enterprise 首发。

OpenAI 发布常驻智能体 dots:云端电脑与浏览器、4000+ 应用,贯通 ChatGPT、Slack、Teams,Pro、Enterprise 首发。

Privatemode 提出免训练方法:给选项编号、预填 choice_index,读一次前向传播的 logits 得到每个选项概率;在 28 个文本数据集上与 Jev 准确率持平,还能处理图像。

vLLM 官方详解文本水印落地:带密钥的 PRF 加 Gumbel 噪声选 token,双密钥兼容投机解码,上下文去重守住多样性,吞吐开销近乎为零。

vLLM v0.30.0 带来 762 次提交:Fast Start 权重缓存守护进程、HiSparse 主机分层、MRV2 双批次重叠,以及多项破坏性变更。

Google 开源的 AX 用四个原语声明式编排智能体:状态存 Redis 而非 etcd,配合 Agent Substrate 实现单集群十亿级任务与亚秒级恢复。

Cloudflare 把自家漏洞挖掘流水线的前身开源为 security-audit 技能:六阶段审计、对抗式验证与机器可读结论,用覆盖率账本决定还要继续查哪里。
![封面:暗色屏幕上显示的 Rust CUDA 内核源码,可见 #[kernel]、#[launch_bounds(256)] 与 DisjointSlice<f32> 等标注](/covers/2026-09-17-cuda-rust-two-tracks.jpg)
NVIDIA 推出 CUDA Rust:cuda-oxide 把 Rust SIMT 内核直接编译为 PTX,cutile-rs 以 Tile 模型在 stable Rust 上写内核,两者都在编译期拦截别名错误。

Hugging Face 发布开源的编码智能体记忆层 Funes:把已在本机的会话记录索引成可检索记忆,支持 Claude Code、Codex、pi、Hermes,可与 Hub 数据集同步、本地推理、私密默认。

SGLang 团队详解 Qwen3.8-Flash-Next 的 Day-0 支持:QSA 稀疏注意力索引开销降 80%,IndexShare 复用 draft 索引,HypCon 内核 2.05× 加速,NVFP4 权重 B200 单请求 540 tok/s。

SGLang 引入 Weight Cache Daemon:常驻 GPU 进程用 CUDA IPC 零拷贝复用权重,加载提速约 785 倍、端到端启动缩短 93.9%,目标 <10s 冷启动、<1s 热备切换。

Modular 宣布 Mojo 全面开源:编译器与工具链以 Apache 2.0(含 LLVM 例外)发布到 GitHub,上周 Mojo 1.0 已实现源码稳定,可从源码自行构建。

量子位深度体验 DeepSeek Harness:一切皆插件的 Agent 框架,内置百余插件与轨迹回放,实测长程任务更强,被称为'Agent 时代的安卓'。

vLLM 首发支持 Nemotron 3.5 Lightning:集成 MTP/DFlash/DSpark 三种投机解码,W4A16 内核提升约 20% 吞吐,可经 OpenAI 兼容 API 部署。

Firecrawl 开源 Rust 库 AnyDoc,无 API Key、零依赖地把 Word、Excel、PPT 等 14 种格式统一转成 Markdown,实测中位耗时 4.4 毫秒。

Knostic 开源基于 LLM 的漏洞发现工具 OpenAnt:Stage 1 检测、Stage 2 攻击,用对抗性反思与受限攻击者人设把误报压到最低。

Cloudflare 推出 Kitesurf——完全运行在 Cloudflare Workers 上的智能体优先浏览器:原生 Rust 编译到 Wasm,通过 Dynamic Workers 隔离,已通过 21.5 万项 WPT 测试,CPU/内存比 Chromium 省 3-7 倍。

LangChain 宣布 Managed Deep Agents 进入公开测试:Python/TypeScript 编写智能体,一条命令部署到 LangSmith 托管运行时,自带持久化、沙箱、Harbor 评测与 Slack 通道。

面向 Ampere 显卡的 vLLM 分支:把 DeepSeek-V4-Flash-0731 的推理支持回移植到 A6000、A100、RTX 30 系,8×A6000 实测 prefill 3435 tok/s、decode 948 tok/s。

OpenClaw 背后的极简编码智能体 Pi:最短系统提示词加四个核心工具,靠扩展系统让 Agent 自己扩展自己。

围绕 DeepSeek 前缀缓存设计的开源编码 Agent:长会话缓存命中 90%+、输入成本约 1/5,单个 Go 二进制,终端/浏览器/编辑器三端通用。