Jev 完全入门教程:不会说话的 AI,凭什么 200 倍速、400 倍省钱地帮程序做决定

TypeSafe AI 新发布的 Jev(System One)不是聊天模型,而是一个返回结构化决策的'AI 决策函数'。本文从概念、三种问题类型、API 实操、置信度分流到真实场景,带你从零上手。

2026 年 9 月 18 日,TypeSafe AI 发布了 Jev——一个不输出任何文字的 AI 模型。五天内 GitHub 上冒出 3000+ 个相关项目,发布周视频播放量动辄几十万。这篇教程带你从零搞懂它是什么、为什么火、怎么用。

01 Jev 到底是什么

一句话:Jev 是一个可以直接嵌入软件的"AI 决策函数"

它和我们熟悉的 ChatGPT、Claude、Gemini 有本质区别:

普通 LLMJev(System One)
核心能力生成内容做判断、做选择
输出一段文字结构化决策(选项/分数/概率)
典型问题“你觉得应该怎么处理?”“这是不是退款诉求?YES 0.91”
程序拿到后还得解析文本直接执行下一步
速度秒级70~500 毫秒
成本$0.2~10 / 百万 token$0.042 / 百万 token(输出免费)

想想程序里真正需要的 AI 判断是什么样的:

  • 这条消息是不是垃圾信息?
  • 这个用户是不是高意向客户?
  • 这个请求需不需要人工审核?
  • 这次操作有没有风险?

这些问题都不需要 AI 写一大段话。程序需要的只是 YES 0.91高风险模型A 这样一个能直接用的答案。

名字的来历:Jev 取自经济学家 William Stanley Jevons(杰文斯悖论的提出者)——越便宜的东西,用得越多。而"System One"则借用了卡尼曼《思考,快与慢》的框架:System 1 是快速的直觉判断,System 2 是慢速的深思熟虑。Jev 就是给 AI 世界补上了"快思考"这一块。

02 为什么 LLM 干不好这件事

普通大模型有两个改不掉的毛病,用在自动化上很要命:

  1. 过度自信:不管懂不懂都答得特别自信。假如某个 AI 判断能做对 95%,听起来不错——但如果你不知道错的那 5% 是什么情况,根本不敢把它接入自动流程。
  2. 输出是给人看的,不是给程序用的。让它判断工单类型,它回你一段"建议先核实订单信息……",程序还得再写一层解析。

Jev 的思路完全不同:每个答案自带一个校准过的把握度(confidence)——官方称模型说 0.8 的时候,在一批案例里大约八成是对的。这套"该确定时才动手,拿不准就老实喊人"的机制,是能真正信任一个自动化系统的前提。一个会说"我不知道"的 AI,比一个永远自信满满的 AI 靠谱得多。

03 三种问题类型:整个 API 就这么点词汇量

Jev 的输入是两样东西:一段状态(state)+ 一组类型化的问题(questions)。问题只有三种:

类型问什么返回什么
Choice从你给的选项里挑一个(最多 255 个)选中的选项 + 每个选项的概率 + confidence
Score按有序等级打分分数(可以落在两级之间)+ 每级概率 + confidence
Noul是 / 否 判断0~1 的概率(接近 1 是强是,接近 0 是强否,接近 0.5 表示它不知道

Noul 不带单独的 confidence,因为概率本身就是把握度。

最关键的设计:所有问题并行且相互隔离地评估。加十个问题几乎不增加响应时间,而且问题之间不会互相污染——长 prompt 里的"context 腐化"在这里结构性地不可能发生。

04 五分钟上手

第一步:拿 API Key

console.typesafe.ai 注册,创建 API Key。不想写代码的话,同站的 playground 里贴段文字、加上问题就能玩。

第二步:装 SDK

# Python 3.10+
pip install typesafe-sdk

JavaScript/TypeScript 也有官方 SDK:@typesafe-ai/sdk

第三步:最小的可用程序

from typesafe_sdk import Noul, TypeSafeClient

client = TypeSafeClient()  # 自动读取环境变量 TYPESAFE_API_KEY

response = client.system_one(
    state="Hi, I have not been able to log in for 3 days. I am losing sales. Please help fast!",
    questions={"urgent": Noul(instructions="This message conveys urgency or time pressure")},
)

print(response.answers["urgent"].noul)  # 0.99

没有 system prompt,没有"请只输出 JSON",没有包着解析器的 try/except——直接拿回一个 float。

05 一个完整的实战例子

客服工单分类是 Jev 的经典场景。一次请求,同时问三个维度

from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()

ticket = ("Hi, I've been trying to connect my Stripe account for 3 days "
          "and it keeps failing. I'm losing sales. Please help ASAP.")

response = client.system_one(
    state=ticket,
    questions={
        "department": Choice(
            instructions="Which team should handle this",
            criteria={
                "billing":   "Payment or subscription issues",
                "technical": "Bugs or integration problems",
                "sales":     "Pricing or account questions",
            },
        ),
        "frustration": Score(
            instructions="How frustrated the customer appears",
            criteria=[
                "Calm, just stating facts",
                "Frustrated but civil",
                "Very angry, strong language",
            ],
        ),
        "is_urgent": Noul(
            instructions="The message conveys urgency or time-sensitivity",
        ),
    },
)

print(response.answers["department"].choice)   # billing
print(response.answers["frustration"].score)   # 1.035
print(response.answers["is_urgent"].noul)      # 0.999

对应的原始 HTTP 请求与响应长这样(不想装 SDK 就直接 cURL):

{
  "answers": {
    "department": {
      "type": "choice",
      "choice": "billing",
      "probabilities": { "billing": 0.84, "technical": 0.159, "sales": 0.001 },
      "confidence": 0.596
    },
    "frustration": {
      "type": "score",
      "score": 1.035,
      "legend": { "0": "Calm, just stating facts", "1": "Frustrated but civil", "2": "Very angry, strong language" },
      "confidence": 0.842
    },
    "is_urgent": { "type": "noul", "noul": 0.999 }
  },
  "usage": { "input_tokens": 312, "output_tokens": 48 }
}

注意两个细节:

  • score 可以落在两级之间:1.035 表示"介于冷静和恼火之间,偏向恼火"。
  • choice 的最高概率不等于高 confidence:billing 赢在 0.84,但 technical 还占着 0.159,概率分布不够"尖",所以 confidence 只有 0.596。这正是 confidence 的意义——它衡量的是整个概率分布的形状。

06 Confidence 三档分流:这才是产品本身

TypeSafe 官方推荐的模式:按置信度把流量切成三档

这个"置信度门控级联"(confidence-gated cascade)有独立数据背书:第三方在 791 个标注决策上实测,8 路分类任务 Jev 整体准确率 83.8%,但在它置信度 ≥90% 的子集上准确率达到 95.5%——把没把握的流量交给更大的模型兜底,比无脑信任每个答案靠谱得多。阈值怎么定?跟着"做错一次的代价"走:错发一封邮件和错扣一笔款,门槛当然不同。

07 设计问题的艺术:大判断拆成小判断

用 Jev 最核心的手艺是提问。不要问大而空的问题,要拆成一堆又小又具体的小问题,再用程序组合答案。

以"判断一封邮件是不是垃圾邮件"为例,最偷懒的问法是直接问"这是垃圾邮件吗?"——又大又含糊,既看不清它凭什么这么判,也没法调整。正确的拆法:

  1. 这封邮件是不是在索要密码之类的登录凭证?(Noul)
  2. 是不是声称你中了个你根本没参与的大奖?(Noul)
  3. 是不是在制造"赶紧行动否则来不及"的紧迫感?(Noul)
  4. 发件人自称的机构,跟它的邮箱域名对不对得上?(Noul)
  5. 链接的落地网址,跟显示文字是不是一回事?(Noul)

每个小问题都具体到几乎没有含糊空间。哪个置信度低,就知道该补哪条规则——可调试、可归因、可迭代,这是大问题打包问法给不了的。

08 真实场景清单

找 Jev 用武之地的口诀:凡是你写过丑陋的 if-else / 正则 / 关键词列表又不满意的地方,凡是目前靠人眼一条条看的地方

  • 电商与平台:商品上架审核(描述匹配类目吗?有没有联系方式引流站外?价格可信吗?)、退货分流(自动通过 / 疑似欺诈标记)
  • SaaS 与 B2B:工单路由、支持对话中的流失信号(给高价值客户的情绪分打预警)、从工单堆里筛功能需求
  • 规模化分析:5 万条评论一次打标(哪个维度抱怨 + 严重程度),直接出看板
  • Agent 架构:模型路由器——按任务复杂度在便宜模型和旗舰模型之间动态调度,Jev 当"调度员"
  • 搜索意图:查询词"apple"是水果还是品牌?是产品名、提问还是拼写错误?

09 价格与性能:官方数据 vs 独立实测

官方口径(TypeSafe 自家 workflow evals,参考答案取 GPT-6 Astra 与 Fable 5.1 的平均):

  • 输入 $42 / 十亿 token(即 $0.042 / 百万),输出 token 免费,比 Claude Fable 5.1 便宜约 238 倍
  • 发布演示:同一决策 Jev 0.114 秒 / $0.000081,对比模型 8.566 秒 / $0.013880 —— 号称 193.6 倍快、444.6 倍省

独立实测(第三方在 791 个标注决策上的对比)要冷静一些:

  • 价格优势真实存在但小于头条数字:对旗舰模型约 40~49 倍便宜,对最便宜的小模型约 4.7~7.5 倍
  • 延迟:中位数 0.33 秒(对比 0.67~1.17 秒),依然显著更快

技术规格:请求上限 64k token(state 最多 32k),限流 25 万 token/秒、1200 请求/分钟。错误码是熟悉的 401 / 422 / 429 / 529。

10 局限与冷静看待

热点面前把丑话说在前面:

  1. 它真的不会算数:官方文档明说 Jev 不能数数、不能比较日期、不能做算术。它是判断力,不是计算器。
  2. 纯文本输入、不可微调:所有人用同一套权重,调优只能靠 state 和问题的措辞。
  3. 黑盒:没有模型卡、没有公开权重、参数量未公开,架构未披露(只说用了新架构 + 并行采样器 + RLCD——面向校准决策的强化学习)。
  4. 校准概率是统计性质:说 0.8 意味着一批同类预测里约八成正确,不保证单个case正确。类型保证了接口,不保证真理。
  5. 标签重叠时会"自信地错":第三方实测里它最有把握的 5 个 8 路分类错误全部集中在同一对容易混淆的意图上——这是标注问题,置信度分数救不了。
  6. 演示数据要打折看:市面上已有不少夸大其词的 Jev demo,官方 benchmark 也是自己人写的 workflow,价格是否补贴未知。

11 核心心法:LLM 生成,Jev 决策,Code 执行

Jev 不会替代 LLM,它代表的是一种不同的分工:

LLM      →  理解和生成(模糊性)
Jev      →  判断和决策(YES/NO、A/B/C、0~100)
Code     →  执行(确定性)
Database →  保存状态

以后遇到问题先自问一句:“我是不是不需要 AI 写一大段话,而只是需要 AI 帮我做一个决定?” 如果答案是"是",System One 就值得考虑。

推荐学习顺序(从零开始别一上来就研究复杂架构):

  1. 理解 Noul → 2. 理解 Choice → 3. 理解 Score → 4. 理解概率与 confidence → 5. 学会设计 Question → 6. 组合 Workflow → 7. 接入 API → 8. 加入评估和监控

记住这套核心工作流就入门了:

输入状态 → 提出明确问题 → 定义输出类型 → Jev 判断
→ 获取概率 → 设置阈值 → 程序执行 → 记录结果 → 持续评估

12 资料汇总

  • 官方控制台(Key 与 Playground):console.typesafe.ai
  • API 端点:POST https://api.typesafe.ai/v1/systemone
  • Python SDK:pip install typesafe-sdk(3.10+);JS SDK:@typesafe-ai/sdk
  • 让 AI 编程助手直接会用:TypeSafe 发布了 agent skill(typesafe-ai/skills),Claude Code 一条命令安装

参考来源:TypeSafe AI 官方文档与发布博客、brieflyglobal.com、projedefteri.com、blog.lepine.pro、botmonster.com、ayautomate.com(第三方实测)。文中性能与价格数字凡标"官方"者均出自 TypeSafe 自报口径,请注意甄别。