2026 年 9 月 18 日,TypeSafe AI 发布了 Jev——一个不输出任何文字的 AI 模型。五天内 GitHub 上冒出 3000+ 个相关项目,发布周视频播放量动辄几十万。这篇教程带你从零搞懂它是什么、为什么火、怎么用。
01 Jev 到底是什么
一句话:Jev 是一个可以直接嵌入软件的"AI 决策函数"。
它和我们熟悉的 ChatGPT、Claude、Gemini 有本质区别:
| 普通 LLM | Jev(System One) | |
|---|---|---|
| 核心能力 | 生成内容 | 做判断、做选择 |
| 输出 | 一段文字 | 结构化决策(选项/分数/概率) |
| 典型问题 | “你觉得应该怎么处理?” | “这是不是退款诉求?YES 0.91” |
| 程序拿到后 | 还得解析文本 | 直接执行下一步 |
| 速度 | 秒级 | 70~500 毫秒 |
| 成本 | $0.2~10 / 百万 token | $0.042 / 百万 token(输出免费) |
想想程序里真正需要的 AI 判断是什么样的:
- 这条消息是不是垃圾信息?
- 这个用户是不是高意向客户?
- 这个请求需不需要人工审核?
- 这次操作有没有风险?
这些问题都不需要 AI 写一大段话。程序需要的只是 YES 0.91、高风险、模型A 这样一个能直接用的答案。
名字的来历:Jev 取自经济学家 William Stanley Jevons(杰文斯悖论的提出者)——越便宜的东西,用得越多。而"System One"则借用了卡尼曼《思考,快与慢》的框架:System 1 是快速的直觉判断,System 2 是慢速的深思熟虑。Jev 就是给 AI 世界补上了"快思考"这一块。
02 为什么 LLM 干不好这件事
普通大模型有两个改不掉的毛病,用在自动化上很要命:
- 过度自信:不管懂不懂都答得特别自信。假如某个 AI 判断能做对 95%,听起来不错——但如果你不知道错的那 5% 是什么情况,根本不敢把它接入自动流程。
- 输出是给人看的,不是给程序用的。让它判断工单类型,它回你一段"建议先核实订单信息……",程序还得再写一层解析。
Jev 的思路完全不同:每个答案自带一个校准过的把握度(confidence)——官方称模型说 0.8 的时候,在一批案例里大约八成是对的。这套"该确定时才动手,拿不准就老实喊人"的机制,是能真正信任一个自动化系统的前提。一个会说"我不知道"的 AI,比一个永远自信满满的 AI 靠谱得多。
03 三种问题类型:整个 API 就这么点词汇量
Jev 的输入是两样东西:一段状态(state)+ 一组类型化的问题(questions)。问题只有三种:
| 类型 | 问什么 | 返回什么 |
|---|---|---|
| Choice | 从你给的选项里挑一个(最多 255 个) | 选中的选项 + 每个选项的概率 + confidence |
| Score | 按有序等级打分 | 分数(可以落在两级之间)+ 每级概率 + confidence |
| Noul | 是 / 否 判断 | 0~1 的概率(接近 1 是强是,接近 0 是强否,接近 0.5 表示它不知道) |
Noul 不带单独的 confidence,因为概率本身就是把握度。
最关键的设计:所有问题并行且相互隔离地评估。加十个问题几乎不增加响应时间,而且问题之间不会互相污染——长 prompt 里的"context 腐化"在这里结构性地不可能发生。
04 五分钟上手
第一步:拿 API Key
到 console.typesafe.ai 注册,创建 API Key。不想写代码的话,同站的 playground 里贴段文字、加上问题就能玩。
第二步:装 SDK
# Python 3.10+
pip install typesafe-sdk
JavaScript/TypeScript 也有官方 SDK:@typesafe-ai/sdk。
第三步:最小的可用程序
from typesafe_sdk import Noul, TypeSafeClient
client = TypeSafeClient() # 自动读取环境变量 TYPESAFE_API_KEY
response = client.system_one(
state="Hi, I have not been able to log in for 3 days. I am losing sales. Please help fast!",
questions={"urgent": Noul(instructions="This message conveys urgency or time pressure")},
)
print(response.answers["urgent"].noul) # 0.99
没有 system prompt,没有"请只输出 JSON",没有包着解析器的 try/except——直接拿回一个 float。
05 一个完整的实战例子
客服工单分类是 Jev 的经典场景。一次请求,同时问三个维度:
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
client = TypeSafeClient()
ticket = ("Hi, I've been trying to connect my Stripe account for 3 days "
"and it keeps failing. I'm losing sales. Please help ASAP.")
response = client.system_one(
state=ticket,
questions={
"department": Choice(
instructions="Which team should handle this",
criteria={
"billing": "Payment or subscription issues",
"technical": "Bugs or integration problems",
"sales": "Pricing or account questions",
},
),
"frustration": Score(
instructions="How frustrated the customer appears",
criteria=[
"Calm, just stating facts",
"Frustrated but civil",
"Very angry, strong language",
],
),
"is_urgent": Noul(
instructions="The message conveys urgency or time-sensitivity",
),
},
)
print(response.answers["department"].choice) # billing
print(response.answers["frustration"].score) # 1.035
print(response.answers["is_urgent"].noul) # 0.999
对应的原始 HTTP 请求与响应长这样(不想装 SDK 就直接 cURL):
{
"answers": {
"department": {
"type": "choice",
"choice": "billing",
"probabilities": { "billing": 0.84, "technical": 0.159, "sales": 0.001 },
"confidence": 0.596
},
"frustration": {
"type": "score",
"score": 1.035,
"legend": { "0": "Calm, just stating facts", "1": "Frustrated but civil", "2": "Very angry, strong language" },
"confidence": 0.842
},
"is_urgent": { "type": "noul", "noul": 0.999 }
},
"usage": { "input_tokens": 312, "output_tokens": 48 }
}
注意两个细节:
- score 可以落在两级之间:1.035 表示"介于冷静和恼火之间,偏向恼火"。
- choice 的最高概率不等于高 confidence:billing 赢在 0.84,但 technical 还占着 0.159,概率分布不够"尖",所以 confidence 只有 0.596。这正是 confidence 的意义——它衡量的是整个概率分布的形状。
06 Confidence 三档分流:这才是产品本身
TypeSafe 官方推荐的模式:按置信度把流量切成三档。
这个"置信度门控级联"(confidence-gated cascade)有独立数据背书:第三方在 791 个标注决策上实测,8 路分类任务 Jev 整体准确率 83.8%,但在它置信度 ≥90% 的子集上准确率达到 95.5%——把没把握的流量交给更大的模型兜底,比无脑信任每个答案靠谱得多。阈值怎么定?跟着"做错一次的代价"走:错发一封邮件和错扣一笔款,门槛当然不同。
07 设计问题的艺术:大判断拆成小判断
用 Jev 最核心的手艺是提问。不要问大而空的问题,要拆成一堆又小又具体的小问题,再用程序组合答案。
以"判断一封邮件是不是垃圾邮件"为例,最偷懒的问法是直接问"这是垃圾邮件吗?"——又大又含糊,既看不清它凭什么这么判,也没法调整。正确的拆法:
- 这封邮件是不是在索要密码之类的登录凭证?(Noul)
- 是不是声称你中了个你根本没参与的大奖?(Noul)
- 是不是在制造"赶紧行动否则来不及"的紧迫感?(Noul)
- 发件人自称的机构,跟它的邮箱域名对不对得上?(Noul)
- 链接的落地网址,跟显示文字是不是一回事?(Noul)
每个小问题都具体到几乎没有含糊空间。哪个置信度低,就知道该补哪条规则——可调试、可归因、可迭代,这是大问题打包问法给不了的。
08 真实场景清单
找 Jev 用武之地的口诀:凡是你写过丑陋的 if-else / 正则 / 关键词列表又不满意的地方,凡是目前靠人眼一条条看的地方。
- 电商与平台:商品上架审核(描述匹配类目吗?有没有联系方式引流站外?价格可信吗?)、退货分流(自动通过 / 疑似欺诈标记)
- SaaS 与 B2B:工单路由、支持对话中的流失信号(给高价值客户的情绪分打预警)、从工单堆里筛功能需求
- 规模化分析:5 万条评论一次打标(哪个维度抱怨 + 严重程度),直接出看板
- Agent 架构:模型路由器——按任务复杂度在便宜模型和旗舰模型之间动态调度,Jev 当"调度员"
- 搜索意图:查询词"apple"是水果还是品牌?是产品名、提问还是拼写错误?
09 价格与性能:官方数据 vs 独立实测
官方口径(TypeSafe 自家 workflow evals,参考答案取 GPT-6 Astra 与 Fable 5.1 的平均):
- 输入 $42 / 十亿 token(即 $0.042 / 百万),输出 token 免费,比 Claude Fable 5.1 便宜约 238 倍
- 发布演示:同一决策 Jev 0.114 秒 / $0.000081,对比模型 8.566 秒 / $0.013880 —— 号称 193.6 倍快、444.6 倍省
独立实测(第三方在 791 个标注决策上的对比)要冷静一些:
- 价格优势真实存在但小于头条数字:对旗舰模型约 40~49 倍便宜,对最便宜的小模型约 4.7~7.5 倍
- 延迟:中位数 0.33 秒(对比 0.67~1.17 秒),依然显著更快
技术规格:请求上限 64k token(state 最多 32k),限流 25 万 token/秒、1200 请求/分钟。错误码是熟悉的 401 / 422 / 429 / 529。
10 局限与冷静看待
热点面前把丑话说在前面:
- 它真的不会算数:官方文档明说 Jev 不能数数、不能比较日期、不能做算术。它是判断力,不是计算器。
- 纯文本输入、不可微调:所有人用同一套权重,调优只能靠 state 和问题的措辞。
- 黑盒:没有模型卡、没有公开权重、参数量未公开,架构未披露(只说用了新架构 + 并行采样器 + RLCD——面向校准决策的强化学习)。
- 校准概率是统计性质:说 0.8 意味着一批同类预测里约八成正确,不保证单个case正确。类型保证了接口,不保证真理。
- 标签重叠时会"自信地错":第三方实测里它最有把握的 5 个 8 路分类错误全部集中在同一对容易混淆的意图上——这是标注问题,置信度分数救不了。
- 演示数据要打折看:市面上已有不少夸大其词的 Jev demo,官方 benchmark 也是自己人写的 workflow,价格是否补贴未知。
11 核心心法:LLM 生成,Jev 决策,Code 执行
Jev 不会替代 LLM,它代表的是一种不同的分工:
LLM → 理解和生成(模糊性)
Jev → 判断和决策(YES/NO、A/B/C、0~100)
Code → 执行(确定性)
Database → 保存状态
以后遇到问题先自问一句:“我是不是不需要 AI 写一大段话,而只是需要 AI 帮我做一个决定?” 如果答案是"是",System One 就值得考虑。
推荐学习顺序(从零开始别一上来就研究复杂架构):
- 理解 Noul → 2. 理解 Choice → 3. 理解 Score → 4. 理解概率与 confidence → 5. 学会设计 Question → 6. 组合 Workflow → 7. 接入 API → 8. 加入评估和监控
记住这套核心工作流就入门了:
输入状态 → 提出明确问题 → 定义输出类型 → Jev 判断
→ 获取概率 → 设置阈值 → 程序执行 → 记录结果 → 持续评估
12 资料汇总
- 官方控制台(Key 与 Playground):console.typesafe.ai
- API 端点:
POST https://api.typesafe.ai/v1/systemone - Python SDK:
pip install typesafe-sdk(3.10+);JS SDK:@typesafe-ai/sdk - 让 AI 编程助手直接会用:TypeSafe 发布了 agent skill(
typesafe-ai/skills),Claude Code 一条命令安装
参考来源:TypeSafe AI 官方文档与发布博客、brieflyglobal.com、projedefteri.com、blog.lepine.pro、botmonster.com、ayautomate.com(第三方实测)。文中性能与价格数字凡标"官方"者均出自 TypeSafe 自报口径,请注意甄别。