
Jev 发布 3 天后开源平替 Laya 来了快 8 倍权重全开一个不写一个字、只输出带概率判定的模型新品类一周之内集齐了闭源版、开源版和两份民间复现。AI 不写字了专管下判断9 月 15 日前 OpenAI 研究员 Diogo Almeida 的公司 TypeSafe AI 发了第一款模型 Jev。这位老哥参与过 RLHF、InstructGPT 和 ChatGPT 的核心研究这次做的模型偏偏把「说话」这个功能整个砍了。Jev 不生成任何文本。你给它一段状态比如一封邮件、一张工单、一段对话记录再给一组限定好选项的问题它一次算完直接吐回判定和概率。三种问法choice 从你定义的选项里挑一个score 按 0 到 3 这种量表打分noul 回答是否问题并给出校准过的 P(true)。官方口径端到端延迟 70 到 500 毫秒比前沿大模型做分类快 20 到 200 倍、便宜 40 到 400 倍。输入每百万 token 0.042 美元输出 token 永久免费对因为根本没有输出 token。价格之外更值钱的是「校准」。模型报 0.85 的置信度长期看真实命中率就在 85% 上下这个数字你敢直接拿去写 if 判断。普通大模型输出的 confidence 0.95 只是预测了一串听起来自信的 token背后没有数学校准这一说。社区三天就玩疯了。Vercel 拿它替换分类器里的大模型实测快 5 到 18 倍准确率还更高。BrowserUse 创始人接了 Jev 的浏览器 Agent 查真实航班全程 7 秒、成本 0.0039 美元99% 的动作决策都交给它。Hacker News 相关讨论冲到 3700 多万浏览。好家伙这个价格一出来各家 Flash 模型都得重新想想定位。名字也不是随便起的Jev 取自经济学家杰文斯暗合杰文斯悖论单次判断成本暴跌整体用量会暴涨。三天不到开源版追上来了那开源呢9 月 18 日印度 ConvAI Innovations 发布 LayaApache 2.0 协议权重、代码、训练脚本、评测集全公开。GitHub 上线三天 6700 starHuggingFace 热门模型榜冲到第三。时间线有点绕。Laya 的作者 Nandakishor Mukkunnoth 在 2025 年 3 月就把非自回归决策模型的论文挂上了 arXiv比 Jev 早了一年多比 Jev 早发论文的人回头做了个 Jev 开源版。Jev 发布三天后他把自己的方案重构成通用版跟进开源正面对标。Laya 本体是个编码器英文版基于 ModernBERT-large总参数 421M多语言版基于 mmBERT-base总参数 322M覆盖 100 多种语言。内置 Router 先毫秒级识别语言再分发到对应 checkpoint。跑起来很省事。pip install laya本地 GPU 推理自托管零 token 费用三个 checkpoint 按需选laya 英文主力、laya-multilingual 多语言、laya-typed-decisions 专攻分支判定生产环境建议 Router(preloadTrue) 预加载不然切换语言要重新加载好几秒速度数字放一起才有感觉。第三方实测 Jev 的 P50 延迟在 236 到 276msLaya 单次判定 32.8ms快了将近 8 倍批量场景下摊到每题只要 7.2ms。一次前向打分快从哪来传统 LLM 是自回归一个 token 接一个 token 串行往外吐哪怕你只要它回一个「A」它也得先把「答案是」几个字写完。Laya 给每个候选项安排一个 [MASK] 标记位整段序列过一遍双向编码一次前向传播同时算出所有选项的分数Softmax 一下就是概率分布。没有文本生成就没有解析失败也没有格式幻觉。你给 A、B、C 三个选项它绝不会自作主张编个 D 出来。训练用的是 RLCD面向校准决策的强化学习奖励函数选严格适当评分规则数学上能证明模型只有报告真实概率才能拿最高分。数据 100% 人类标注不走合成捷径。有个细节我挺喜欢。它带一个「行动还是升级」的决策头用成本矩阵训练自动执行错了罚 3 分做对只奖 1 分转人工只罚 0.5 分。算下来置信度低于 62.5% 就老实转人工这个阈值不是拍的是罚则算出来的。数字要看全Laya 也有输的光看厂商的一面之词不行把两边公开数据摆在一起。指标JevLaya单次判定延迟P50 约 236 到 276ms32.8msT4 GPUtyped-decisions 准确率0.7270.766微调 checkpoint校准误差 ECE越低越好0.2460.081Banking7777 类0.8700.425默认配置开源情况闭源 APIApache 2.0 全开两个坑得说清楚。第一Laya 那个 0.766 的成绩来自在这个 benchmark 训练集上专门微调过的 checkpoint模型卡自己承认的这点挺诚实不算完全公平的对决。第二选项一多 Laya 会崩Banking77 上 77 个类别Jev 拿 0.870Laya 默认配置只有 0.425原因是每个选项分到的 token 预算太少。选型思路就一条25 个选项以内的意图路由、安全护栏、工单分流Laya 又快又便宜校准还好。几十个以上类别的精细分类目前还是 Jev 稳或者老实回大模型。同期还有两份开源复现Jev 把这条路线带火之后开源圈 48 小时内卷出了好几个版本除了 Laya 我还翻了两个。NimbleBespoke Labs 出品Qwen3.5-9B 做 LoRA 微调数据、训练配方、权重全开源。思路是对比式数据构造改一个关键事实让标签翻转逼模型学会抓重点。自家评测里基座 66%、Nimble 90%、Jev 93%H100 上约 100msMacBook 本地能跑。说实话这条我只看了发布帖没跑过APUS 麒麟合盛 9 月 19 日放的复现MIT 协议打包成开箱即用的 fast-browser-use 技能专攻浏览器自动化。Qwen3.5-9B 纯本地离线跑M2 Pro 笔记本上维基检索任务中位约 18 秒完成单任务模型打分只有 4 次零云端调用同一个范式48 小时内出了三条工程路子。Nimble 走 9B 生成模型微调Laya 走小编码器小、快、准APUS 走场景复刻。你想自托管决策能力现在选项比一周前多了一倍。点链接打游戏翻车的不少路由、分类这类直路判断Jev 们确实能打。可场景一变成「下一步该点哪个链接」「这局什么时候该点」翻车的案例就多起来了。最扎眼的是 Browser Use 创始人自己做的长链任务测试就是那位 7 秒订机票的博主。20 道真实网页任务对照的 Luna 拿了 17 分Jev Agent 只拿 1 分19 道直接失败。输得不冤7 秒订机票是填表、选择、提交一条直路没有分支真实网页会弹验证码、弹广告、点进死路Jev 没有推理也不会回溯卡住就是卡死。这位创始人的原话浏览器交互从来不是简单的元素点击是高维状态空间搜索。游戏这边也一样。有人拿 2048 测它只给棋盘不给别的成绩比乱猜还差24% 的步子是原地空挪把每一步的预计算结果喂进状态里中位分直接翻三倍多。井字棋更说明问题约 8% 的局面不管怎么改提问都答不对因为正确答案需要推演「我走这步之后对面怎么应」单次前向没有草稿纸这种题它天生做不了。还有个坑特别阴。有人做链接选择时为了省 token把页面截断成前 25 个候选正确答案排在第 103 位8 次全错而且模型每错一次都报 0.76 以上的置信度。选项没给全它不会说不知道只会从烂菜单里挑一个最顺眼的。交易更别碰。有开发者让 Jev 持续判断买卖一晚亏掉 31680 美元德州扑克 GTO 对照测试里真正有争议的点位吻合率只有 38%。小马智行架构师程墨的测试更值得琢磨无论把规则改成优先到达还是越快越好两难场景里它都坚持选急刹车脑子里那套默认规则排在用户指令前面。Agent 里的判断多少要过大模型这事跟做 Agent 的人直接相关。你想想看一个 Agent 跑一轮要调用多少次大模型意图路由、安全检查、结果验收、下一步选哪个工具大部分是二选一或五选一的快速判断却都在按推理模型的价格排队。Jev 这一波验证的就是快慢分工。System 2 的慢思考留给大模型System 1 的快判断交给毫秒级决策模型两边各干各的。我自己先试了一小步。RAG 问答 Agent 里的模型路由和工具选择这两步原来每步都要过一遍大模型几百毫秒到一两秒不等。换成决策模型之后是几十毫秒的量级粗算快了 10 到 30 倍token 钱基本归零。把丑话说在前面只测了这两个场景没做严格基准别的环节不敢下结论。再看上面那些翻车案例就清楚了长链任务、屏幕上的时序判断、需要推演和回溯的活老实留给大家模型。也别指望决策模型替代大模型它替代的是你 Agent 里那些「其实不需要动脑子」的判断。你的 Agent 里这种判断占几成评论区聊聊。数据来源TechCrunch2026-09-18、量子位、Artifilog、AI Pro Playbook、新华网2026-09-21、央广网2026-09-20、腾讯云开发者社区、ZiCode、shaharia.com、robertwent.com、GitHubNandhaKishorM/laya、bespokelabsai/nimble、HuggingFaceconvaiinnovations/laya数据截至 2026-09-22