
判定模型一类不做生成的新模型2026-09-26 · AI 观察笔记今天聊了一件事有一类模型它不写字。你问它一个带类型的问题它只回一个选项加一个概率 —— 然后就没了。听起来像退步。但它抢的恰恰是「让大模型干一件小事」的位置。⚠️先说清楚来源本篇的事实来自公开仓库的 README和一条视频总结不是我在自己机器上跑出来的。凡是我标了来源的可以顺着去核没标的就当听说。序 · 今天聊了什么#事一句话1一类不做生成的模型输出不是一段话是「选项 概率」2三种交互形态挑一个 / 打个分 / 给个概率3⭐ 它和普通分类器的差别概率是校准过的所以敢设阈值自动放行4它的边界控制流、阈值、副作用 —— 三样必须留自己手里5一次实测工具装上了数据源拿不到6怎么判断该不该用它一张决策清单第一部分 · 概念它出的是判断不是话1.1 先对上名字系统一Jev—— TypeSafe 出的那个模型公开口径是fast, typed, confidence-aware decisions in software快、有类型、带把握的判断。Laya—— 它的开源同款在本地芯片上跑不调云。两个名字同一类东西System One系统一。比喻人的判断分两层 ——一眼就看出来的系统一和要坐下来算半天的系统二。大语言模型干的是系统二的活慢、贵、但什么都能聊。这类模型只干系统一—— 不假思索但极快。1.2 分水岭输出形态同样一个问题两种模型的回法完全不同大语言模型 问这条投诉该归哪个组 答「根据描述中提到的账单问题我判断这应该归 billing 组处理。 不过也有一小部分可能性属于 technical……」 判定模型 问这条投诉该归哪个组schemabilling / technical / sales / other 答{billing: 0.81, technical: 0.07, sales: 0.09, other: 0.03}能不能直接进if / switch就是那条线。前者的答案你还得再解析一遍、再猜它的把握有多大后者拿到就能用 —— 它连我有多确定都替你算好了。比喻一个是请你帮我分析一下另一个是让你在四个格子里打个勾并标出你有多确定。前者信息更丰富但你要自己从一段话里把结论刨出来后者信息窄但它就是结论本身。1.3 三种交互形态这类模型对外一般只开放三种问法形态你问什么它回什么工程上对应Choice从这几个里挑一个选中的那一个 概率分布分类Score给这个打几分一个分数打分Probability是 / 否0 到 1一个概率值概率判断有意思的是这三种都不生成文字—— 没有话这个中间层也就没有它写了一段很漂亮但跑偏了的话这种事。1.4 七类活外加一个闸门按公开口径它能接的活是七类分类 · 路由 · 打分 · 排序 · 检测 · 抽取 · 校验再加上一类很特别的闸门gate。闸门不是产出内容是决定某个动作该不该执行这条消息发不发、这个请求放不放、这个动作允不允许往下走。这一类最值得注意—— 因为它以前几乎只能靠人写规则或者靠调一次大模型然后拿自然语言去猜。1.5 ⭐ 真正的差别概率是不是校准过的这是今天最值钱的一条。有一份公开研究仓库AnyJev把普通大模型改造成这个口径实测对比指标改造前改造后它意味着什么顺序翻转率0.2300.073把选项顺序打乱答案就翻脸的比例校准误差0.2400.095说80% 确定实际真的对 80% 吗可自动裁决比例5% 风险以下7.7%52.0%能自动放行、不用人看的比例「顺序翻转率」是照妖镜—— 把选项 A、B 换个位置答案就变了说明它其实没在判断只是在顺着上下文往下接。而最后一行才是重点自动化能做掉多少不取决于模型强不强取决于你敢不敢设阈值。而敢不敢设阈值取决于概率准不准。校准误差从 0.24 降到 0.095带来的不是更准了是一条活里有一半可以直接自动做掉剩下转人。1.6 量级它不是更便宜的大模型它是另一种东西本地开源同款在 Apple Silicon 上直接跑短判定中位13.4ms0 output token不用 PyTorch、不调云 API。成本一份第三方审计里抓 1,204 个页面、跑4,816 次类型化判定一共$0.0048。⚠️宣传口径单列推广方给的说法是「提速 193.6 倍、成本降 444.6 倍、输入每百万 token $0.042」。这三个数我没有实测、也没找到第三方复现—— 按我自己的规矩宣传语要单独标出来不能和实测数字混在一张表里。差别不在价格在形态大语言模型判定模型干什么生成一串 token一次前向出枚举值输出一段话选项 概率适合写、聊、推理判、选、卡1.7 边界这段比优势更重要三条官方口径自己写的不生成文本—— 写文案、长链推理、对话都别用它不要拿它当通用模型—— 它是专用件不是小号 GPT⭐最终的控制流、阈值、副作用必须留在你自己的代码里。第三条是它的设计立场不是免责声明它只负责给出那个判断和把握不负责替你动手。比喻它是仪表盘上的一个读数不是替你开车的司机。读数可以信但踩不踩刹车还是你的事—— 这句话反过来也成立出了事不能怪读数。第二部分 · 生态一个模型要落地周边得配齐这类模型不是下载一个权重就完事配套一圈挺齐件作用本地 runtime在消费级芯片上跑不用 GPU 集群语言侧调用件Node / TypeScript 直接调不用自己写协议本地服务起一个本地进程当判定服务MCP 连接器接进 agent 体系当决策层用评测 / 护栏件一次一个 trace、按分计费用来盯它的判断质量但今天我觉得最值得抄的不是上面任何一个是这个2.1 人们在拿它干什么一条视频里列了十个开源蓝图方向 —— ⚠️清单来自视频总结我没有逐个实测只当别人在这么用看方向玩法浏览器操作AI 决定「点哪个按钮」只在拿不定主意时才调模型玩游戏直接读游戏内存状态自动操作角色通关无人机 / 机械臂低频率自主控制、关节步进编程上下文管理替换掉压缩摘要这一步—— 摘要不再是生成而是判定给 AI 当决策层拦截并辅助另一个模型做决策安全检查运行前扫源码查供应链投毒有意思的是这几个方向都不生成内容全是在做一个决定。还有一个真实用法的例子值得记有人拿它审代码、给完成度打分低于阈值就打回重做。这就是这类模型最典型的落地形态 ——打分 阈值 打回判断留下、动作归人。2.2 ⭐ 一份写给 agent 的SKILL.md社区里有一份 agent skill内容不是代码是规程—— 教写代码的 agent「接这个模型时」问题该怎么问schema 怎么定阈值该怎么定校准该怎么做有哪些坑模型不是重点「怎么用」才是。一份能被人和 agent 同时读的操作规程比多一个模型有价值 —— 因为模型会换代规程不会。第三部分 · 一次实测装上了 ≠ 能用3.1 起因想把一条视频转成文档。公开仓库里正好有现成的 agent skilldouyin-video-to-doc-skill抖音链接 → 文案 markdown装上。3.2 装是装上了skill 就位命令能跑。3.3 失败在取数据这一步顺着短链走短链 ──302──► 分享页约 32KB能拉到 │ └── 正文里没有文案 只有一条 meta 「于 20260926 发布在抖音已收获 0 个喜欢…」日期读到了内容读不到。页面里的关键那句话压根不在 HTML 里 —— 它在视频里不在网页里。3.4 ⭐ 结论别写反这一条我要专门记不是工具坏了是数据源拿不到。这两句话在报告里的分量完全不同写法读到的人会怎么做❌ 「这个 skill 不能用」换工具 —— 换了还是拿不到✅ 「链路通但分享页正文里没有文案」换通路 / 换数据源 —— 这才是真问题这正是我 09-19 那篇里写的证据分三档我这里是实证—— “页面里没有这段文字”我拉下来看过不是推断—— “这个工具不行”那是我猜的。第四部分 · 怎么判断该不该用它清单你的活长这样用它输出是有限的几个选项、要进if/switch✅ 正合适要给把握、要设阈值自动放行✅ 这是它的主场要给自动化当闸门放不放行✅ 特别合适要写一段文案、要对话、要多步推理❌ 别用它是专用件只是想用个模型试试❌ 没有明确判定任务就别引落地前先做三件事顺序不能换拿一批标注数据校一次—— 先看它的概率准不准再谈阈值定阈值并且把阈值写进你自己的配置里不要散在代码各处副作用留自己手里—— 它给判断动作由你执行。收尾 · 今天最该记的三条它出的是判断不是话。能不能直接进if/switch是这类模型和大模型的分水岭。自动化能做掉多少取决于概率校准不取决于模型强不强。校准误差降一半可自动裁决的比例能翻好几倍。「装上了」和「能用」之间隔着一个数据源。失败时先分清是工具不行还是通路不行 —— 结论写反了方向就全错。附 · 为什么这篇没有语法段今天这条线没有代码、没有语法—— 全程是概念和判断硬凑一段语法出来只会变成编。按惯例语法段放文末附录这篇空着等哪天真在自己代码里接了这类模型再补一段带实测的。本文为学习笔记。文中模型、仓库与数字均来自公开资料公开 README / 第三方研究 / 视频总结非本机实测视频宣传口径的数字已单独标注。