TypeSafe AI 创始人 Diogo Almeida 曾在 OpenAI 参与构建「让语言模型听懂指令、能与人对话」的方法,这批研究后来成了 ChatGPT 背后的工作。但他认为对话模型离真正的自动化仍缺一块关键拼图:模型早已在对话上超人多年,自动化却迟迟没有到来。 在隐身研发两年之后,TypeSafe AI 发布了首个 System One 模型——一类为「软件可以直接使用的快速、结构化决策」而生的一批前沿模型,并在今天开放首个公开模型 Jev 的早期访问。

官方称,Jev 在 System One 类任务上的智能水平与现有 LLM 相当,却快两个数量级、效率高两个数量级。它放弃了字符串生成,转而针对结构化输出优化,并且不可能出现类型错误(type error)、不可能幻觉。用作者的话概括:Jev 就是一次「前沿智能的函数调用」——非结构化的状态输入,带类型的概率化决策输出。「非凡的主张需要非凡的证据」,文章随后给出了详细的技术结果与自我设限说明。

TypeSafe 官网 System One 模型主视觉

新旧两种「前沿」

现有 LLMSystem One + Jev
优化方式基于人类反馈的强化学习(RLHF)/ 可验证奖励强化学习(RLVR)面向校准决策的强化学习(RLCD,Reinforcement Learning for Calibrated Decisions)
优化目标人类偏好:人类评分者更喜欢的文章与对话回复;可验证奖励:能被程序自动校验的输出校准决策:在 System One 任务上给出认识论诚实的概率
输入非结构化数据(如文本),强调序列化消息非结构化数据(如文本),强调结构化程序状态
输出字符串 / 生成文本。字符串极其灵活,可以是对话、代码、幻觉、拒答,也可以是类型安全的结构化值。但软件要用它,必须先解析 + 校验,且永远存在「跑偏」的风险类型安全的结构化值。可能的输出与结构事先定义,模型永远不会犯类型错误;所有答案都附带校准过的概率与置信度
采样方式顺序采样,一次一个 token,每个都以前一个为条件并行采样,一次查询生成全部输出,效率极高且硬件感知
成本输入 token:0.20–10 美元/百万 token;输出 token 约为输入的 5 倍输入 token:0.042 美元/百万 token(42 美元/十亿 token);输出 token 免费(便宜到无法计量)
速度前沿模型端到端响应时间 3–329 秒。与人交互足够快,但嵌入代码后成为巨大瓶颈TypeSafe 端到端响应时间 70ms–500ms,对同等级前沿智能的 System One 类查询最高快 40×–200×
置信度即便被要求给置信度,模型也往往过度自信且前后不一致。如果一个模型 95% 的时候能做对,却说不清哪 5% 做不对,这项任务就无法被自动化每个输出都携带置信度与不确定性。校准过:置信度越高,准确率越高;更一致:相似输入返回相似答案
典型用例人在环任务(聊天机器人、Copilot、编码智能体),通用强大但需要人监督;可验证问题(数学证明、kernel 优化);演示 DemoAI 驱动的工作流 / 智能 if 语句;对大数据做 map-reduce;实时应用;验证一切——打分、评判、校验、护栏、检测越狱

TypeSafe 把 System One 的定位说得更直白:结构化输出像「模糊的判定规则」一样嵌入普通软件中,去分类、路由、打分、抽取或分支,比手写逻辑更不容易脆断;而外围代码会约束模型的自由度,让它更容易被编排进可靠的系统。

证据与技术结果

文章把主张分成两类。可以轻易验证的三条:速度(官方承认评测多在西海岸的笔记本上跑,服务目前也部署在那里)、成本(价格公开透明,但补贴与否需要长期验证,官方预期价格只会下降)、类型安全(只要有一个反例就能推翻,而这在数学上不可能)。

对更大胆的主张,作者选择主动加限定条件:

并排演示(Side-by-side demonstration)

并排演示展示了 Jev 与 LLM 的关键差异:Jev 并行输出全部概率,而非逐 token 自回归生成。字符串极其强大通用,但代价昂贵;「放弃」字符串反而带来了大量超能力。作者也坦白了这场演示的偏向:查询被高度简化,questions 的键特意取成人类可读的描述性名称;state 也写得短而密,以突出采样方式的差异——「相对较短的输入让我们的模型看起来占优」。录屏中唯一与 GPT-5.6 Terra 不一致的是「流失可能性等级(Churn likelihood level)」,而作者认为这个答案本身确实存在歧义。演示选用 GPT-5.6 Terra 的默认推理档,因为它在平均智能水平上与 Jev 最可比。顺带一提:正是类似的演示说服团队「全力押注 System One 方向」。

工作流评测(Workflow evals)

TypeSafe 提出了一种新的评测方式,用来衡量 AI 在代码中工作的真实表现。它不追求某个标准答案的分类,也不允许测试框架与模型发生变化(否则可能通过「框架工程」过拟合)。取而代之的是:假定存在一张正确的计算图(一段用代码表示的「工作流」),并用最大、最聪明、最昂贵的外部模型的预测作为参考概率。换句话讲,每个模型跑同一套工作流,比较它们与「最聪明模型平均值」的差距——此处参考值是 GPT-6 Astra 与 Fable 5.1 的平均。

4 条工作流上的平均准确率 vs 成本:Jev 几乎独占近两个数量级的帕累托前沿

官方给出的结论很直白:Jev 冲出了图表,几乎独占近两个数量级的帕累托前沿。 他们也对比了「把所有逻辑都塞进思维链、自己生成提示词」的做法,结果显著更差。评测中的调用远比并排演示复杂,因为它们更能代表真正的业务自动化生产负载。下面四条工作流中最简单的一条,是安全告警的三段式处置流程:

最简单的一条工作流:Triage / Disposition / Containment 三段式告警处置

作者强调,现实中可靠的工作流往往由大量相互独立、被拆解的问题组成,其细粒度行为依赖概率而非离散决策;最终结果仍是离散分支,但通往答案的过程需要大量高度一致的领域工程。首页上 193.6 倍更快、444.6 倍更便宜的说法就来自这里,官方认为这已属于真实世界收益的偏高档位。他们同时声明:这些工作流并非为美化模型而挑选或构造,也不在训练分布内,但作者来自模型能力团队,偏差仍可能存在;参考答案取 GPT-6 Astra 与 Fable 5.1 的平均值,会偏向 OpenAI 与 Anthropic,因此很可能低估了自家模型与 DeepSeek 模型。评测中 LLM 一侧使用官方开源的 System One LLM 包装器,把 LLM 约束成与 TypeSafe API 兼容的结构化决策——这是从 LLM 获取决策最准确的方式,但更慢也更贵。

幻觉与类型安全

结构化输出错误率与工具调用错误率对比,Jev 为 0

幻觉与类型安全本质相关,而作者认为后者是自动化的入场门槛。在智能体里出现一次幻觉的工具调用只是不便,但如果它位于有延迟保证的系统中、或深埋于依赖链的几层之下,就是彻底的灾难。 现有模型无论多聪明,依然会幻觉、依然有类型错误。这里同样有自我设限:LLM 的数据来自 OpenRouter,很可能存在偏差(更复杂的查询可能被路由到更强的模型);而 TypeSafe 的 0% 并非实测值,而是因为 schema 匹配被数学保证,所以可以放心地画成零。

两个有趣的 Demo

作者认为最令人兴奋的是新用例的解锁,团队最爱的两个是:

Doom。「我们喜欢这个 Doom,它展示了实时智能,以及代码 + AI 能做什么。」负责实现的工程师原本担心每秒 10 次查询(约合 7 美元/小时)太贵,其余人却一致认为低于预期。官方计划发布深度拆解,并举办黑客活动。限定条件:这个 Demo 的输入是「带文本的数据结构」而非图像(暂时);非 AI 的 Doom 机器人能打得更好,但团队要的是一个能对不同表示形式做出反应、最重要的是「能听指令」的机器人。

Wikiracing(维基竞速)。 玩法是从一个维基百科页面出发,仅通过沿途遇到的链接抵达指定页面,每一步都可能在数百到数千个链接中选择。它非常适合展示「每秒智能」,以及高基数选择下「不幻觉」带来的复利收益。限定条件:第二、第三场挑战都以「Rubber Duck」开头纯属巧合,作者是团队提醒后才发现的;这里的加速比明显小于此前的 Demo,因为对手是非推理模式(Astra 也调到最低推理档),这也让 Jev 往往用更少步数完成——正是更聪明的信号;调低档位是为了让演示不至于看不下去。Jev 支持最高 255 的基数,对更高基数的选择,系统会先独立打分、再做一次显式选择,因此偶有变慢。

下一步

Jev 仍处于早期。官方表示管线里还有更多东西,会持续发布,正在尽快把开发者从等待名单里放出来,并希望听到「你需要自动化哪些决策、Jev 在哪里好用、在哪里不够好」。

命名与 FAQ

作者把命名当作回答这个问题的入口:这两个名字来自 Daniel Kahneman 的《思考,快与慢》——「系统 1」是快速、直觉的思考,「系统 2」是缓慢、审慎的推理,模型类别名正取自这一区分。他们也承认「系统 1 思维」长期带有「容易出错」的隐含意味,但相信 System One 模型可以被做得比替代方案更可靠,原因日后详述。Jev 则取自 William Stanley Jevons:他们预期机器智能会走一条与煤炭相似的路——蒸汽机效率提升反而推高了煤炭需求;智能成本每下降一个数量级,就会解锁更多数量级的用例。

原文的 FAQ 还列出了另外五个问题(为何需要新的训练算法、Jev 适合什么用例、Jev 是不是只是更小的 LLM、Jev 在公开基准上表现如何、训练数据来自哪里),但页面上尚未给出答案。

核心总结

  • 发布内容:TypeSafe AI 公开首个 System One 模型 Jev,即日开放早期访问;
  • 核心主张:在 System One 类任务上与现有 LLM 智能相当,但快两个数量级、便宜两个数量级,端到端 70ms–500ms;
  • 形态之变:放弃字符串生成,输出事先定义好的类型安全结构化值,并行采样、输出 token 免费,并不可能产生类型错误;
  • 训练方法:以 RLCD(面向校准决策的强化学习)取代 RLHF / RLVR,目标从「人类偏好」换成「认识论诚实的概率」;
  • 评测口径:工作流评测以 GPT-6 Astra 与 Fable 5.1 的平均预测为参考,官方首页宣称 193.6 倍更快、444.6 倍更便宜;
  • 自我设限:速度依赖就近部署、成本可持续性待长期验证、0% 类型错误是数学保证而非实测、参考模型选择可能低估自家表现。

原文:Introducing System One Models & Jev(TypeSafe AI,2026-09-15)