
人工智能大模型预训练模型评测模型量化【免费下载链接】RWKV-LMRWKV (pronounced RwaKuv) is an RNN with great LLM performance, which can also be directly trained like a GPT transformer (parallelizable). We are at RWKV-7 Goose. So its combining the best of RNN and transformer - great performance, linear time, constant space (no kv-cache), fast training, infinite ctx_len, and free sentence embedding.项目地址https://gitcode.com/gh_mirrors/rw/RWKV-LM点击查看免费下载本文围绕 Research/rwkv7-g0-7.2b.md 所记载的 RWKV-7 G0 7.2B 模型发布笔记系统解读该模型的训练背景、零 SFT/RL 的纯预训练推理表现、推荐采样参数与运行方式并结合 RWKV-LM 仓库中的推理 Demo、CUDA kernel 与训练脚本说明如何在本地复现、加载与实测这一模型。读完本文你将掌握 G0 7.2B 的权重获取路径、三类推理模式GPT / RNN / 混合快速的工程实现细节以及其自纠错、改题推理、误导性提问鲁棒性等行为特征的完整证据链。一、模型背景从 RWKV-6 World-3 续训到 RWKV-7 G0原文档开篇即给出了 G0 7.2B 的来历作者在 RWKV-6 World-3 7.6B 的基础上追加了2T两万亿token的语料继续训练得到 RWKV-7 G0 7.2B其权重文件命名为rwkv7-g0-7.2b-20250722-ctx4096.pth发布在BlinkDL/rwkv7-g1模型仓库下该仓库名亦出现在 RWKV-v7/rwkv_v7_demo_rnn.py 的下载注释中可从仓库文件注释处获取下载地址。几个关键事实值得明确它是预训练基座模型未做 SFT监督微调未做 RL强化学习语料本身包含大量来自 Hugging Face 生态的 instruction / chat / reasoning 数据上下文长度为 4096见文件名ctx4096参数规模 7.2B属中等偏大规模文档同时透露作者已在训练 RWKV-7 G013.3B版本作者对它的定性是很可能是迄今最强的纯 RNN 模型——这是模型作者的主观评价读者应将其视为发布声明而非独立评测结论。在仓库中RWKV-7 Goose x070 是当前主线的正式发布版本见 RWKV-v7/README.mdG0 系列模型正是基于 x070 架构的预训练产物因此仓库中的推理与训练代码均可直接用于承载 G0 权重。二、核心发现RNN Pretrain Scaling is all you need原文档最重要的结论是一句话RNN Pretrain Scaling is all you need。支撑这一结论的实测表现有两点推理中的自我纠错模型能够在推理过程中发现并纠正自己的错误修改题目的鲁棒性把原题的数字、符号、表述做改动后模型仍能给出正确或接近正确的解答。这一结论的意义在于它试图证明线性时间、常数空间的 RNN 架构RWKV-7在足够大的预训练规模下不需要显式的 SFT/RL 阶段也能涌现出类推理能力。文档作者据此认为纯 RNN 只要叠加足够规模的预训练数据就可以覆盖此前被认为需要 transformer 对齐训练才能达到的能力区间。三、如何运行 G0 7.2B采样参数与仓库内推理方案3.1 推荐采样参数原文档直接给出了两套开箱即用的采样配置并注明适用倾向采样配置行为特征temp0, topp0, penalty0 0贪心解码通常可行但有时会卡住陷入重复或停滞temp0.3, topp0.3, penalty0 0作者认为可能更好引入少量随机性与截断缓解贪心解码的停滞问题其中penalty0 0表示 presence penalty 与 frequency penalty 均为 0即不做重复惩罚完全交给概率分布本身。对于需要稳定复现答案的场景可优先用贪心对于长程推理、需要探索不同解法的场景建议用第二套。3.2 仓库提供的三种推理模式仓库为 RWKV-7 x070 提供了三种推理入口均可加载 G0 系列权重GPT 模式并行前向RWKV-v7/rwkv_v7_demo.py。以 transformer 式的一次性前向完成整段输入适合 prefill 与批处理文件头部注释明确说明该模式比 RNN 模式慢指逐 token 自回归生成时。RNN 模式逐 token 递推RWKV-v7/rwkv_v7_demo_rnn.py。维护固定大小的隐状态逐 token 生成生成阶段更快但 prefill 阶段非常低效两种模式在文档源码中互为补充。混合快速模式RWKV-v7/rwkv_v7_demo_fast.py。GPT RNN 混合more efficient通过wkv7s单步 kernelRWKV-v7/cuda/wkv7s.cu、RWKV-v7/cuda/wkv7s_op.cpp实现。使用前需要做两处本地化修改模型路径三个脚本头部均有MODEL_NAME/MODEL_PATH变量把 G0 权重路径填进去即可脚本示例路径是 RWKV-Runner 目录下的占位路径模型超参对于 0.1B 小模型脚本给出的示例是n_layer12, n_embd768, vocab_size65536, head_size64G0 7.2B 属于更大规模需按权重实际结构配置n_layer/n_embd并在代码注释确认head_size_a64不可改动、DTYPEtorch.half为推荐精度。3.3 词表与加载细节G0 系列沿用 RWKV 的 65536 词表 RWKV-v7/rwkv_vocab_v20230424.txt。RNN 模式脚本中有几处值得注意的加载细节权重加载后统一squeeze()去除冗余维度并将blocks.0.att.w0保持为 float32emb.weight与第一层ln0做 LayerNorm 融合F.layer_norm节省一次前向计算第 0 层的v0/v1/v2value residual 参数实际被忽略脚本直接以a0/a1/a2填充占位源码注释写明 actually ignoredRNN 模式下每层维护3 个状态att_x_prev上一 token 输入[n_embd]、att_kv线性注意力状态形状[H, N, N]float32 精度、ffn_x_prevChannelMix 上一 token 输入[n_embd]全部初始化为零张量。这正体现了 RWKV常数空间、无 KV-cache的特性。3.4 精度与加速开关推理脚本开头统一启用了cudnn.benchmark、TF32 矩阵乘法并通过torch.utils.cpp_extension.load在运行时即时编译 CUDA kernelwkv7用于 GPT 模式批量前向wkv7s用于 RNN 模式单步递推编译参数包含--use_fast_math -O3以及-D_N_64的 head size 宏。若关闭USE_CUDA_KERNEL脚本会退化为纯 PyTorch 朴素实现源码注释标注UNOPTIMIZED, VERY SLOW仅适合调试。四、能力实测从原文档记录的测试看推理行为原文档主体是一组针对 G0 7.2B 的交互式测试记录原始截图托管在 GitHub未随仓库分发故本文以文字完整还原每个测试场景供读者在本地复现时对照。4.1 基础数学题一题多解作者先给出一道基础数学题模型给出了一种解法随后更换措辞重问同一题模型改用另一种方法正确作答——表明模型不是死记硬背题目模板而是能按题面语义调用不同的求解路径。4.2 修改题目的系列鲁棒性测试这是原文档最有价值的一组实验逐项修改题面要素观察模型行为修改内容测试意图数字改动如把 99 改为 99.1检验数值扰动下的纠错能力模型能够发现并纠正自己的错误符号改动如把1^改为i^提升难度检验对幂/指数符号变化的适应指数底数改动如把4^x改为8^x检验对表达式结构变化的泛化分数改动如把1/5改为1/4检验对常量扰动的敏感度与重新推导能力语义表述改动如把 one hat 改为 two hat检验对题面实体数量变化的鲁棒性作者指出即使题面被改动、甚至模型在推理中出现偏差它仍能自行察觉并在后续步骤中纠正这是自我纠错行为最直接的证据。4.3 多次自展开self-rollouts在另一道题上模型经过多轮自我展开self-rollouts即自身多次推理尝试后给出了正确答案。文档借此说明该模型具备在长程生成中反复推敲、最终收敛到正解的能力。4.4 误导性问题misleading questions作者看到一篇关于误导性问题的论文后用 G0 7.2B 进行了验证测试一个误导性问题模型给出合理应对再测另一个随后改动其中一个数字再测检验在误导性前提下对数值变化的处理是否依然稳健。这类测试旨在考察模型不被题面陷阱带偏、保持推理一致性的能力。4.5 简单代码题与 AIME代码题文档展示了两个简单代码问题的求解记录AIME 更新文档末尾 UPDATE 部分记录到G0 7.2B 能够解答部分简单的 AIME美国数学邀请赛题目并且同样通过了修改题目的检验——即对 AIME 原题做改动后仍可正确作答。注意原文档对这些测试以截图呈现并未给出每道题的完整文字题面与输出。本文仅还原测试类型与结论具体数值结果请以本地复现为准不宜据此外推具体得分。五、评测情况与总体结论文档末尾作者贴出了若干评测截图并提及了 UncheatableEval一个公开评测空间的结果随后给出总体评价Overall I think its decent for pure RNN pretrain 2T tokens——即对纯 RNN 2T token 预训练的组合而言这个表现是合格的。需要强调的是原文档未在正文中给出任何具体评测数值因此本文不列出任何数字结论。如果你希望自行量化 G0 的表现仓库提供了可直接使用的评测工具MMLU 评测脚本RWKV-v7/rwkv_mmlu_eval.py内置mmlu_test_dataset/mmlu_dev_dataset仓库已随附数据使用TEMPLATE构造User/Assistant格式的题目并比较 A/B/C/D 选项 token 的对数似然还支持HF_MODE切换到 Hugging Facetransformers后端脚本注释提示该模式当前速度较慢LAMBADA 测试两个推理脚本均内置了 LAMBADA 困惑度与准确率计算读取 RWKV-v7/misc/lambada_test.jsonl 数据逐条输出ppl与acc可在加载 G0 权重后直接运行作为快速自检。六、后续计划8T 数据、DeepEmbed 与更大规模原文档列出了清晰的路线图数据规模扩大到 8T token作者持有的完整数据集已远超当前 2T计划继续 scale up引入 DeepEmbed以及可能后续的DeepEmbedAttention两项面向嵌入/注意力机制的架构改进作者在社交平台上有相关预告同步训练 RWKV-7 G0 13.3B更大参数量版本已在训练中与 7.2B 构成规模梯队。结合 RWKV-v7/train_temp/README.md 可知RWKV-7 的预训练基础设施MiniPile 1.5G token 演示、DeepSpeed Stage-2、bf16 精度、逐参数 lr/wd/init 定制在本仓库中完整可用社区可据此沿同一套配置向更大规模复刻实验。七、仓库工程配套G0 背后的架构与训练支撑7.1 x070 架构的两大核心算子G0 基于 x070 架构其前向主干在 RWKV-v7/rwkv_v7_demo.py 中清晰可见每个 Block 由TimeMix时间混合RWKV_Tmix_x070与ChannelMix通道混合RWKV_CMix_x070组成TimeMix是本架构的灵魂。其中w -softplus(-(...)) - 0.5将衰减系数软钳制到(-inf, -0.5]再经exp(-exp(w))得到逐 token 的指数衰减a sigmoid(...)被作者注释为in-context learning rate上下文内学习率决定状态更新的强度v v (v_first - v) * sigmoid(...)是跨层value residual首层 v 向后续层回传key 经F.normalize做 L2 归一化并乘k_kln_x使用 GroupNorm 且eps64e-5源码特别标注该 eps 值不可随意更改。状态递推由 CUDA kernel 完成GPT 模式调用 RWKV-v7/cuda/wkv7.cu 的批量版本核心更新式为state state * w state a b v k^Tb 为-kk与kk*a构成内积外积组合随后以state r读出输出RNN 模式的wkv7s.cu则是同一数学式的单步版本。7.2 训练侧为什么 RWKV-7 没有独立的层train_temp/README.md 特别指出RWKV-7 是整个模型层面精心配置的产物——每个参数都有各自的初始化、权重衰减与学习率策略因此不存在可直接复用且保证效果一致的独立 RWKV-7 层。这既是其readily scalable and very stablespike-free的原因也是将其移植到其他任务时必须研读 RWKV-v7/train_temp 代码仅数百行并按需定制的原因。以 README 中 1.5BL24-D2048权重示例表为参考可以观察到几个关键设计参数分组关键设计emb.weight/head.weight/ 各*.weight大矩阵标注wdecay只对这些大张量施加权重衰减否则性能明显变差blocks.*.att.w0标注lr 2x享受双倍学习率blocks.*.att.v0/v1/v2仅存在于 layer 1第 0 层忽略推理脚本已证实blocks.*.att.ln_x初始化按代码定制ln_x.bias为 0head_size固定 64D_N_64编译宏训练入口为 RWKV-v7/train_temp/demo-training-prepare.sh生成初始权重rwkv-init.pth与 RWKV-v7/train_temp/demo-training-run.sh正式训练后者给出的关键参数及其含义包括CTX_LEN512修改 ctx_len 时必须同步用magic_prime小于datalen/ctxlen-1的最大3n2素数重新计算M_BSZ16约占用 7G 显存显存不足可调小、追求速度可调大LR_INIT6e-4 / LR_FINAL6e-5数据量越大可适当增大模型越大应减小微调场景建议1e-5级别GRAD_CP/HEAD_CHUNK显存与速度的权衡开关参考 loss 曲线0 4.875856 ... 11 3.295895README 要求复现时逐行偏差须在±0.01以内否则说明环境配置有问题。结语RWKV-7 G0 7.2B 是纯 RNN 大规模预训练路线的标志性样本2T token 的语料、零 SFT/RL 的基座形态却展现出自我纠错、改题推理、误导性问题鲁棒与部分 AIME 解题能力。仓库内配套的 GPT/RNN/混合推理脚本、wkv7/wkv7sCUDA kernel、65536 词表、MMLU/LAMBADA 评测工具与 MiniPile 训练演示为任何想要复现、验证或继续扩展这一路线的开发者提供了完整的工程闭环。如果你打算在本机实测 G0建议按贪心失败则换temp0.3, topp0.3的采样策略并先从 RWKV-v7/rwkv_v7_demo_fast.py 入手获得最快的生成体验。赞分享人工智能大模型预训练模型评测模型量化【免费下载链接】RWKV-LMRWKV (pronounced RwaKuv) is an RNN with great LLM performance, which can also be directly trained like a GPT transformer (parallelizable). We are at RWKV-7 Goose. So its combining the best of RNN and transformer - great performance, linear time, constant space (no kv-cache), fast training, infinite ctx_len, and free sentence embedding.项目地址https://gitcode.com/gh_mirrors/rw/RWKV-LM点击查看免费下载相关推荐独角数卡开源自动化售货系统的企业级架构深度解析独角数卡开源自动化售货系统的企业级架构深度解析 在数字化交易日益普及的今天中小型电商和虚拟商品销售平台面临着一个共同挑战如何在有限的开发资源下构建稳定、可后端电商Visual C Redistributable AIO终极一站式解决方案告别DLL错误烦恼Visual C Redistributable AIO终极一站式解决方案告别DLL错误烦恼 你是否曾经因为找不到msvcp140.dll或应用程开发工具WSL 里让 Docker 看见 NVIDIA 显卡跑通 HeyGem.ai 的 5 个检查点WSL 里让 Docker 看见 NVIDIA 显卡跑通 HeyGem.ai 的 5 个检查点 HeyGem.aiDuix.Avatar是一个本地部署数字人工智能AI 应用数字人媒体生成桌面应用创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考