
GLM-5.3 接入指南:OpenAI 兼容 API 与思考参数配置
GLM-5.3 已全量开放:1M 上下文、128K 输出、思考模式始终开启。一文理清 API 协议、迁移要点与调用示例。

GLM-5.3 已全量开放:1M 上下文、128K 输出、思考模式始终开启。一文理清 API 协议、迁移要点与调用示例。

原版 vLLM 0.25.1 在 4× RTX PRO 6000 上部署 DeepSeek-V4-Flash:不 fork、不打补丁,256K 上下文、约 133 tok/s、完整工具调用;并如实记录两条官方上限。

用 200GbE 直连的双 DGX Spark 以 vLLM 部署 DeepSeek-V4-Flash-0731(TP=2、百万上下文),单流 60–70 tok/s,本文梳理关键注意事项与实测数据。

New API 是聚合多厂商大模型的开源 API 网关,支持 OpenAI、Claude、Gemini 格式互转与计费管理,本文介绍其特性与 Docker 部署配置。

开源生产栈在单块 MI300X 部署 DeepSeek-V4-Flash:FNUZ FP8 修复、DSpark-7 投机解码,单流 168.6 tok/s。

手把手部署 vLLM 与 Mooncake 的 PD 分离推理:MooncakeConnector 通过 RDMA 跨节点直传 KV 缓存,峰值带宽 142.25 GB/s,覆盖 V1 与 V0 两种后端。

手把手部署 vLLM + MooncakeStore 分布式 KV 缓存池:CPU/SSD 卸载、跨实例前缀缓存共享、XpYd 灵活编排,覆盖 V1 与 V0 两种后端。

CUDA Graph 强大但限制不少:捕获期间不能同步、图拓扑与参数静态冻结、流捕获必须自包含、内存生命周期等九类约束详解。

一份面向深度学习开发者的 CUDA Graph 中文介绍:启动开销从哪来、图如何定义与执行,以及 PyTorch 里怎么用。

DeepSeek 官方提供一键脚本和手动配置两种方式接入 Codex,CLI、ChatGPT 桌面端、VS Code 插件共用一份配置。

Simon Willison 的轻量评测套件 smevals:目录即评测、YAML 配任务、脚本当裁判,还能让编码智能体自己搭评测。