最后更新:2026-09-20 · 来源:typesafe.ai、渠道商列表、独立媒体(文中附链接)

Jev 是什么?TypeSafe System One 模型完整解读

Jev 是 TypeSafe AI 于 2026 年 9 月 15 日发布的全新模型品类——System One Models——的第一个成员。它不生成文本,而是针对你的输入回答带类型的问题,返回附带校准置信度的结构化决策。这篇指南讲清它的工作原理、能做什么不能做什么,以及哪些说法你应该亲自验证。

太长不看版

聊天模型的问题

RLHF 时代的 LLM 为「产出人类喜欢的文字」而优化。这让它们在遵循指令上超越人类——但作为软件组件却不可靠:模式坍缩、过度自信、编造自由文本、每个答案都裹着散文。如果你的应用真正需要的是「这张工单属于这 4 类中的哪一类」或「这个来源是否支持这个论断」,聊天模型是一条昂贵又嘈杂的路径,只为得到一个比特的答案。

TypeSafe 的赌注是:人们目前交给 LLM 的相当大一部分工作,其实是披着聊天外衣的结构化决策——这部分理应拥有自己的模型品类,原生地被机器消费。

Jev 怎么工作

输入:state + 类型化问题

一次 HTTP 请求包含 state(待判断的文本块——工单、段落、日志)和一个或多个问题,每个问题有固定的答案类型。响应在单次调用中返回所有答案及概率。

{
  "state": "我的 Stripe 账户连了 3 天一直失败,我正在丢单。",
  "questions": {
    "urgency":   { "type": "noul",   "statement": "这条消息表达了紧急感。" },
    "category":  { "type": "choice", "options": ["账务", "技术", "销售", "垃圾信息"] },
    "frustration":{ "type": "score",  "scale": ["低", "中", "高", "危急"] }
  }
}

训练:RLCD,而非 RLHF

TypeSafe 为 Jev 设计了新架构、新采样器和名为 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)的训练算法。优化目标是校准度——0.9 就应该真的代表 90% 概率——而不是人类对生成文风的偏好。这也是它无法输出无效答案的原因:输出形状在架构层固定,不靠提示词工程约束。

输出:决策 + 置信度阈值

策略由你的代码决定:高于 0.9 自动执行,0.6–0.9 之间升级给人工,再低就回退到前沿 LLM。TypeSafe 的原话:「在代码中组合这些决策来构建更大的工作流,由你掌控智能的使用方式。」

三种题型原语

原语返回示例问题
Choice选项之一 + 概率「这张工单属于哪类?」→ 账务(0.91)
Score有序评分 + 概率「这个告警多严重?」→ 高(0.87)
Noul陈述为真的概率「这段话是否否认了它引用的论断?」→ 0.95

三种题型可共享同一次请求——常见做法是「投机式扇出」:把可能需要的所有问题一次性问出去,由代码挑选相关答案,因为输入是唯一计费项,多问几个问题几乎不增加成本。

评测数据——及其水分

TypeSafe 在 4 个工作流(安全事件响应、agent 轨迹可观测、发票处理、客服)上做了自建评测:

模型准确率*单例成本延迟
Jev67.8%$0.00040.4 s
GPT-5.6 Terra67.9%$0.030410.1 s
Claude Sonnet 567.8%$0.11778 s
Claude Opus 573.1%$0.176137.8 s
GPT-5.6 Sol74.1%$0.083623.3 s
看星号再看表格
  • *「准确率」是一致性,不是真值。共识标签由 GPT-6 Astra 与 Claude Fable 5.1 生成——它衡量的是与两个前沿模型的一致程度,TypeSafe 也承认这偏向 OpenAI 和 Anthropic。
  • 厂商自跑。工作流、评测框架、运行全部由 TypeSafe 完成,尚无中立框架的独立复现。
  • 「0% 错误」是结构性的。「零幻觉」「0% 格式错误」源自 schema 保证,不是测量结果。格式有效的答案仍可能是带高置信度的错误答案——这正是发布后 Hacker News 讨论最激烈的点。
  • 社区共识:先在自己的流量上评测,再决定是否依赖这些数字。

价格速览

JevGPT-5.6 TerraClaude Sonnet 5
输入 / 1M tokens$0.042$2.00$3.00
输出 / 1M tokens$0$12.00$15.00
单决策例成本~$0.0004$0.0304$0.117

各渠道逐一报价和可交互的成本计算器见价格页

局限性

正确的心智模型

Jev 不是更便宜的 LLM,而是一个恰好有智能的类型化函数调用:直接返回代码可用的值,附带置信度。有了它,很多只为「在字符串输出中活下来并做校验」而存在的代码就不需要存在了。发布几天内,开源项目 openjev 就在小开源模型上复刻了这套接口模式——说明这个原语的生命周期可能超过任何单一厂商。

怎么试用

从零代码到完整 API 的三条路径,我们在获取方式指南里逐步讲清——包括经 Vercel、Cloudflare、OpenRouter 的免排队路径。什么时候该用 Jev、什么时候该用前沿模型,见 Jev vs 大模型;具体工作流见使用场景