Jev:一个不写字的AI模型,凭什么让开发者抢到API宕机?

发布时间:2026/9/24 8:15:26
Jev:一个不写字的AI模型,凭什么让开发者抢到API宕机? 2026年9月15日一个叫 Jev 的模型发布了。它不聊天、不写代码、不解释自己只给你一个概率数字。上线当天涌入的开发者把 API 直接挤爆了。Jev 到底是什么30秒说清你给它一段文字 几个问题它给你几个数字结束。举个具体例子。你收到一封用户投诉邮件你的程序需要判断三件事输入你发给 Jev 的 状态「订单延迟三天了客服一直没人回复我要退款」 问题1需要紧急处理吗是/否 问题2该转给哪个部门客服/物流/技术/其他 问题3严重程度打几分1~5分 输出Jev 返回的 问题1 → 0.94 ← 94% 概率需要紧急处理 问题2 → 客服 ← 87% 置信度该转客服 问题3 → 4.2 ← 严重程度 4.2 分你的代码拿到这几个数字直接if判断完事。没有一段文字回复没有 JSON 解析没有 Markdown 代码块。就是几个数字。为什么这东西突然火了因为开发者受够了用 LLM 干杀鸡用牛刀的活。以前的流程程序需要判断一封邮件是不是垃圾邮件 → 调 GPT → 等 5 秒 → 花 3 分钱 → 解析它返回的一大段文字 → 提取里面的结论。现在的流程调 Jev → 等 0.1 秒 → 花 0.004 分钱 → 拿到一个数字0.97→ 完事。快了 20 倍便宜了几百倍结果还差不多。和 XGBoost 有什么区别如果你做过机器学习你可能会想这不就是 XGBoost 做分类吗本质上确实是同一类东西——都是输入数据 → 输出概率的预测模型。核心区别只有一个XGBoostJev输入表格数据你得自己提取特征原始文本邮件直接丢进去特征工程你手动做模型自己懂语义提问方式固定的列数值、类别自然语言“这是不是钓鱼邮件”以前的流程邮件文本 → 人工提取特征 → 转成表格 → XGBoost → 概率现在的流程邮件文本 → 直接丢给 Jev → 概率Jev 真正的卖点是省掉了特征工程这一步。它用 LLM 级别的语义理解能力干 XGBoost 的活。背景ChatGPT 老兵做的反共识产品TypeSafe AI 成立于 2024 年创始人 Diogo Almeida 曾在 OpenAI 工作约四年是 InstructGPT 论文的主要作者之一这篇论文就是 ChatGPT 指令遵循能力的基础。公司隐身两年2026 年 9 月 15 日正式亮相同步完成4000 万美元种子轮DCVC 领投估值约 2 亿美元。Almeida 的判断很直接大规模自动化中机器与机器的交互会远多于人与机器的交互。聊天从来不是自动化的正确工具。当所有人都在卷更大、更聪明、更能聊的模型时他反其道而行做一个不会说话的模型。为什么它能这么快、这么便宜原因砍掉了逐字生成传统 LLM 写一句话是一个字一个字往外蹦的自回归——生成 100 个字要跑 100 次推理。Jev 不写字。它对所有问题只跑一次推理所有答案同时出来。这就是为什么LLMJev回答方式逐字生成一次并行算出延迟3~329 秒70~500 毫秒输出成本按字数收费免费没字可收训练方法不光要答对还要心里有数Jev 使用自研的RLCD校准决策强化学习。核心思想一句话模型说我有 80% 把握的时候事后真的大约 80% 是对的。这叫校准Calibration。普通 LLM 的问题是你问它确定吗它永远说确定——过度自信。Jev 的训练目标是让它的自信程度和实际情况对得上。这有什么用你可以设一条线置信度低于 0.6 的丢给人工处理高于 0.9 的自动执行。LLM 给不了你这种可靠的阈值。三种提问方式Choice选择从选项里挑一个 → 例这封邮件该转给哪个部门客服/物流/技术/其他 → 最多 255 个选项 Score打分在量表上评个分 → 例这个代码片段质量打几分1~10 Noul是非回答是/否 → 例这是不是钓鱼邮件 → 返回 0~1 的概率0.5 五五开一个实用技巧一次请求可以问多个问题所有问题并行评估延迟几乎不变。发 1 个问题和发 13 个问题速度差不多只多付问题本身的 token。官方数据 vs 第三方实测有水分但方向是真的官方宣称比前沿 LLM快 193.6 倍、便宜 444.6 倍输入 $0.042/百万 token输出免费“零幻觉”——不可能输出选项外的值第三方独立测试来源测试内容速度优势准确率官方头条最佳案例193.6x—Every777 个判断25x抓到 6/7 瑕疵GPT 全中 7/7Near Here50 真实审核~5x96% vs 对照组 84%Good Start Labs6003 项检查—91.5% vs DeepSeek 93.5%jev-decision-bench49 任务 8225 条中位延迟 105ms42/49 匹敌或超基线结论方向是真的倍数有水分。第三方实测速度优势普遍在5~25 倍而非 193 倍。官方数字取的是分子分母都挑最有利的极端值——就像说我比博尔特快 10 倍结果是拿你 100 米的成绩除以他跑 1000 米的时间。零幻觉的准确理解Jev不可能返回你没给过的选项这是数学保证所以不存在编造字段、编造 JSON这种 LLM 常见问题。但它可以在选项之内自信地选错。比如选项是客服/物流/技术它可能以 95% 的置信度选了错误的那个。错误形式从编造文本变成了自信地做错决定——后者其实更隐蔽。真实案例谁在用1. Vercel前端云平台安全分类器原来用 GPT 审查命令安全性换成 Jev 后速度快5~18 倍准确性更高上线 24 小时内近 13% 付费团队接入2. Bryo AI商业邮件分类Jev vs GeminiGemini 准确率微高但贵10~20 倍开发者评价“唯一能回传真实概率的模型极度适合自动化工作流”3. Agent 监控用便宜模型盯贵模型用 Jev 实时监控 LLM Agent 的操作拦截越狱尝试比用 Agent 监控 Agent 便宜得多4. 模型路由先判断要不要动用大模型简单任务 → 小模型处理复杂任务 → 旗舰模型处理Jev 负责做这个分流判断成本几乎可以忽略5. 实时游戏决策TypeSafe 演示了 Jev 玩 Doom每秒 10 次决策每小时约 $7一场国际象棋快棋赛中Jev 击败了 Anthropic 的模型对方超时了代码示例LangChain 集成fromlangchain_classifiersimportTypeSafeClassifier classifierTypeSafeClassifier(modeljev-latest)resultclassifier.invoke(state用户投诉订单延迟三天没人回复,questions{is_urgent:{type:noul,instructions:是否紧急},department:{type:choice,instructions:该转给哪个部门,options:[客服,物流,技术,其他]},severity:{type:score,instructions:严重程度,levels:[低,中,高]}})# result.answers.is_urgent.probability → 0.92# result.answers.department.confidence → 0.87直接调 APIcurlhttps://api.typesafe.ai/v1/systemone\-HAuthorization: Bearer$TYPESAFE_API_KEY\-HContent-Type: application/json\-d{ state: 用户三天前付款失败客服无人回复, questions: { is_urgent: {type: noul, instructions: 需要紧急处理吗}, category: {type: choice, instructions: 问题类型, options: [支付, 客服, 技术, 其他]} } }注册即送 $5 额度约 1.2 亿 token不需绑卡。也可以通过 Vercel AI Gateway、Cloudflare AI Gateway 等平台访问。中文用户必看训练以英语为主中文可用但准确率更低中文客服判断测试中准确率约64~65%中文实体识别较弱「¥199赠运费险」往往只识别出「¥199」优势在速度和成本——每题 0.73 秒、50 题合计 0.002 美元建议先拿自己手头几十条带标注的真实数据跑一遍看概率和你的标注对不对得上再决定是否接入。限制与风险诚实版限制说明黑盒参数量、架构、权重全部未公开没有技术论文非确定性同样的输入重复跑答案会有微小浮动不是精确复现没有解释只给概率不告诉你为什么这么判定价可能有补贴$0.042/百万 token 可能是烧钱换市场仅支持文本不支持图像、音频基准有偏官方测试用其他 AI 的答案当标准答案不是人工标注适用场景判断规则✅ 适合错误代价低、量大的任务分类、路由、前置筛选❌ 不适合错误代价高的任务资金、法务、需要可审计理由的判断和 LLM 的关系不是替代是分工LangChain 官方的定位最准确开放式推理和生成交给 LLM过程中的快速结构化决策交给 Jev。用户请求 → Jev 判断复杂度和路由70ms, $0.0004 → 简单任务小模型处理 → 复杂任务旗舰模型处理 → Jev 监控 Agent 输出实时、低成本 → 低置信度 → 转人工Jev 不是更聪明的 LLM而是把某一类高频操作做到便宜和快两个数量级让以前不划算的用法变得可行。类比数据库索引之于全表扫描——不是更聪明而是把查找这个操作做到快两个数量级。总结维度评价方向✅ 真实需求填补了传统分类器和 LLM 之间的空白速度/成本优势✅ 方向真实但倍数被美化实际 5~25x vs 宣称 193x“零幻觉”⚠️ 只保证格式合法不保证答案正确中文支持⚠️ 可用但不是强项需自行验证校准能力⚠️ 是核心卖点但目前只有小样本验证定价可持续性❓ 可能有补贴后续涨价风险最终定位Agent 系统的快判断层不是 LLM 替代品一句话总结当带概率的智能 if 语句用是赚的当小号 GPT 用是要翻车的。参考资料TypeSafe AI 官方博客、TechCrunch、TechSpot、Wikipedia、LangChain 博客、人人都是产品经理、华尔街见闻、DataSci Ocean 等。数据截至 2026-09-23Jev 处于早期访问阶段性能数据可能变化。