
vLLM Decode Context Parallelism:把长上下文 KV 缓存“切开”分摊到每张卡
vLLM 详解 Decode Context Parallelism:沿序列维度切分 KV 缓存而非按注意力头复制。单 8×B200 测 Kimi K2.6,显存占用 82% 时吞吐仍达 6091 tok/s/GPU,是张量并行的 3 倍以上。

vLLM 详解 Decode Context Parallelism:沿序列维度切分 KV 缓存而非按注意力头复制。单 8×B200 测 Kimi K2.6,显存占用 82% 时吞吐仍达 6091 tok/s/GPU,是张量并行的 3 倍以上。

vLLM 团队公布 Qwen3.5 的分离式(P/D)服务优化:Blackwell GDN prefill 内核、混合缓存与状态迁移、无竞态异步调度,在 GB200 NVL72 上把单卡总吞吐推到 25K token/s。

Zapier 开源的 AI 智能体基准:600 个跨 47 个模拟 SaaS 的业务任务,要求自动发现 API 并遵守业务规则,公开集最强模型通过率约 50%。

用 200GbE 直连的双 DGX Spark 以 vLLM 部署 DeepSeek-V4-Flash-0731(TP=2、百万上下文),单流 60–70 tok/s,本文梳理关键注意事项与实测数据。

New API 是聚合多厂商大模型的开源 API 网关,支持 OpenAI、Claude、Gemini 格式互转与计费管理,本文介绍其特性与 Docker 部署配置。

面向 Ampere 显卡的 vLLM 分支:把 DeepSeek-V4-Flash-0731 的推理支持回移植到 A6000、A100、RTX 30 系,8×A6000 实测 prefill 3435 tok/s、decode 948 tok/s。

Codex Security 是 OpenAI 的应用安全代理,从 Aardvark 走向开源,已扫描 3000 万+ 提交、修复 7 万+ 漏洞,推动行业转向补丁自动化。

开源生产栈在单块 MI300X 部署 DeepSeek-V4-Flash:FNUZ FP8 修复、DSpark-7 投机解码,单流 168.6 tok/s。