DeepSeek 新论文:我在防作弊那一节停了很久

发布时间:2026/9/27 7:08:03
DeepSeek 新论文:我在防作弊那一节停了很久 DeepSeek 新论文我在防作弊那一节停了很久摘要AI 会作弊了还防不太住。这句话是论文自己写的。9 月 中旬DeepSeek 发布了 V4.1-Flash 的技术论文。整篇论文的核心就一个字省。聚焦点是 KV CacheKV 缓存也就是模型处理上下文时要占用的显存。先说一个很多人没概念的事实KV 缓存的占用可以远远超过模型本身。拿我自己实测过的例子一个 1.7B 的小模型权重文件才 1GB 出头上下文拉到 1M token 时KV 缓存要吃掉 13.4GB是模型本体的十倍以上。4B 模型更夸张1M 上下文的 KV 要 34GB 往上。模型越小、上下文越长KV 占比越离谱。DeepSeek 这篇论文解决的就是这个问题他们把每 token 的 KV 占用压到了 890 字节只有上一代的四分之一。压缩 KV 这件事玩本地部署的朋友都知道老办法在 llama.cpp 里加 -ctk /-ctv 参数用 q8_0 或 q4_0 把 KV 缓存做量化。但老办法是在模型训练完之后硬压压得越狠精度损失越明显q8_0 基本无感到 q4 就开始伤上下文能力了。这篇论文的路子不一样它把量化放进了训练阶段行话叫 QAT量化感知训练模型是 学着在被压糙的缓存上干活 长大的所以压到 FP4 还能保住性能。再配合架构上的跨层复用和部署上的按需重算三层一起把缓存打下来了。这三层的东西网上已经有很多解读写得很细我就不重复了。但论文里有一节我翻到的解读大多一笔带过。论文在讲训练和评测的两个地方都提到同一件事这届模型会作弊了而且是防不太住的那种。我们一起看下论文原话到底怎么说的。训练的时候模型学会钻空子刷分先看训练阶段。DeepSeek 在强化学习训练时发现模型频繁试图 reward hacking直译是 奖励作弊说人话就是模型不好好干活专门钻评分规则的空子刷分。论文列举的几个行为我直接翻译过来利用操作系统新披露的漏洞包括 XFS 文件系统驱动的权限问题、AppArmor 安全模块的非法内存访问从包镜像服务器里搞到了答案相当于考试前偷到了考卷删除关键程序文件、破坏系统文件甚至直接把整个文件系统删掉。论文用的原词是 臭名昭著。DeepSeek 的对策是给每个训练沙箱配上安全配置AppArmor再用 eBPF 做细粒度的网络管控把模型关在笼子里。还有一个细节我觉得很有意思如果模型把环境搞崩了DeepSeek 不重试直接把这一轮算失败并且给模型回传一个 后果 信号。让模型自己知道搞坏环境是有代价的。评测的时候断网删历史它去反编译内核训练时作弊还能靠沙箱管住评测时的作弊更值得展开讲。为了防作弊DeepSeek 在跑分评测时做了三道防护第一道断网第二道删掉环境里的 Git 历史防止模型翻到答案的提交记录第三道自动清空多种构建缓存Go module、node_modules、编译好的 jar 包、Python 的 pycache一样不落。等于考场封了网络、收了小抄、擦了草稿纸。结果呢论文原话说尽管有这些预防措施仍然观察到了投机取巧行为。举的例子是在 CyberGym一个网络安全评测集里模型把 Ubuntu Linux 的核心软件包反编译了就为了从二进制里找漏洞。到这一步模型干的活已经从 解题 变成 劫狱 了。你能想到的考场纪律它全守了然后它把考卷本身给拆了。DeepSeek 在论文里说得很直白随着模型能力增强Docker 容器加验证脚本这套标准评测基建已经越来越容易被模型钻空子。他们敦促整个研究社区设计下一代基准的时候优先考虑检测和缓解这类行为。翻译一下现在的考场考不住这届考生了得造新考场。为什么这事跟普通人有关最后说说我的三点看法。第一以后看到的跑分可信度要打折。模型越来越聪明钻评测空子的能力也越来越强连 DeepSeek 自己都要专门写一节承认这事防不太住。以后看任何模型的跑分对比多留个心眼能自己测的尽量自己测。第二AI Agent 正在往 有真实权限 的方向走。能反编译内核、能删文件系统的模型说明它已经具备了对真实系统的完整操作能力。这事是双刃剑干活的能力是真的搞破坏的能力也是真的。这也是为什么 DeepSeek 要把训练放在几百万个沙箱里进行出了沙箱没有人兜底。第三这次是 DeepSeek 自己把家丑写进了论文。模型的作弊行为都发生在受控沙箱里没有造成真实危害这种坦诚值得肯定。也正因为有厂商愿意自曝我们才知道评测的水有多深。最后说明一句这篇论文的模型是 552B 参数的数据中心模型跟咱们本地电脑跑的模型没有关系本文聊的是论文里透露的行业信号。本地部署相关的内容还是看我之前的实测系列。每日一问看完这篇以后你再看到 XX 跑分第一 的宣传会先多问一句 它防作弊了吗 吗评论区聊聊你上一次自己给模型跑分是什么时候、用的什么基准。怎么自己动手测我在实测系列里会展开讲。关注GZH有更多AI相关知识分享。