InternLM2.5-20B 模型卡深度解析:模型特性、基准评测与部署应用实践

发布时间:2026/10/6 1:56:21
InternLM2.5-20B 模型卡深度解析:模型特性、基准评测与部署应用实践 大模型人工智能基础模型AI Agent【免费下载链接】InternLMOfficial release of InternLM series (InternLM, InternLM2, InternLM2.5, InternLM3).项目地址https://gitcode.com/gh_mirrors/in/InternLM点击查看免费下载InternLM2.5 是 InternLM 系列的第二代升级版本本文以官方 InternLM2.5-20B 模型卡 为骨架系统梳理 20B 规模基座模型与对话模型的能力定位、开源渠道与基准评测结果并结合当前仓库中的 测试用例、Agent 实践 与 推理指南 等源码级资料展开部署与调用实践。读完本文你将完整掌握 InternLM2.5-20B / InternLM2.5-20B-Chat 的能力边界、评测口径、获取方式以及基于 Transformers、LMDeploy 与 Lagent 的落地用法。一、模型概览两个版本两种定位InternLM2.5 作为 InternLM 系列第 2.5 代面向实际应用场景开源了 200 亿参数规模的基座模型与对话模型。为方便不同用户与研究者使用每个规模都开源了两种版本在 20B 档位上分别是InternLM2.5-20B基座模型使用通用领域数据与领域增强语料进一步预训练在评测中获得出色表现同时具备良好的语言能力。官方建议在大多数应用中优先考虑 InternLM2.5 系列模型。InternLM2.5-20B-Chat对话模型在 InternLM2.5 基座之上通过监督微调SFT与在线 RLHF进一步对齐得到。它表现出更好的指令跟随、聊天体验与函数调用function calling能力官方推荐用于下游应用开发。这一基座 Chat的双版本结构与整个 InternLM2.5 系列的定位一致。仓库 README.md 在模型库一节中进一步说明InternLM2.5 系列包含 1.8B、7B、20B 三个规模7B 模型适合研究与常规应用20B 模型能力更强、可支撑更复杂的场景其中 1.8B、20B 两个规模于 2024-08-05 与 7B2024-07-03相继发布。二、核心能力特性模型卡明确列出 InternLM2.5 的两项关键特性这也是 20B 档位最值得关注的卖点突出的推理能力Outstanding reasoning capability在数学推理任务上取得领先表现。评测章节的数据详见后文显示InternLM2.5-20B 在 MATH 基准上达到 48.0较上一代 InternLM2-20B 的 32.66 有显著提升Chat 版本在 MATH0-shot CoT上更是达到 64.7超越对比模型 Gemma2-27B-IT50.1。更强的工具使用能力Stronger tool useInternLM2.5 支持从100 多个网页中搜集信息对应实现已随 MindSearch 项目发布在指令跟随、工具选择与反思reflection等与工具利用相关的能力上有更好的表现。仓库内 Agent 实践文档 指出InternLM2.5-Chat 在代码解释器与通用工具调用上进一步增强——通过改进且更泛化的指令理解、工具选择与反思能力InternLM2.5-Chat 能更可靠地支撑复杂 Agent 与多步工具调用。三、模型仓库与获取方式Model ZooInternLM2.5-20B 与 InternLM2.5-20B-Chat 均已开源官方同时提供多种权重格式与下载渠道完整信息如下模型Transformers(HF)ModelScope(HF)OpenXLab(HF)OpenXLab(Origin)发布日期InternLM2.5-20Binternlm2_5-20binternlm2_5-20binternlm2_5-20binternlm2_5-20b-original2024-08-05InternLM2.5-20B-Chatinternlm2_5-20b-chatinternlm2_5-20b-chatinternlm2_5-20b-chatinternlm2_5-20b-chat-original2024-08-05注上表以各平台对应的模型标识符repo id呈现可按标识符在 HuggingFaceTransformers、ModelScope 与 OpenXLab 各平台检索下载其中标注-original的为 InternLM 团队自研格式。关于两种格式模型卡给出明确说明HF指 HuggingFace 在 Transformers 中使用的格式可直接通过transformers的AutoTokenizer/AutoModelForCausalLM配合trust_remote_codeTrue加载。Origin指 InternLM 团队在 InternEvo 训练框架中采用的原始格式。仓库 tests/test_hf_model.py 恰好印证了这一点其TestBase与TestChat测试类分别将internlm/internlm2_5-20b与internlm/internlm2_5-20b-chat作为参数化用例通过AutoTokenizer.from_pretrained(model_name, trust_remote_codeTrue, use_fast...)与AutoModelForCausalLM.from_pretrained(model_name, torch_dtypetorch.float16, trust_remote_codeTrue)完成 HF 格式模型的加载与对话推理验证说明 HF 权重格式与 Transformers 生态完全打通。四、性能评测两代对比与同级对照官方使用开源评测工具OpenCompass对 InternLM2.5 系列进行了评测以下是 20B 档位的关键结果更多结果可查阅 OpenCompass 排行榜。4.1 基座模型与 InternLM2-20B 的同代际升级对比BenchmarkInternLM2.5-20BInternLM2-20BMMLU74.2567.58CMMLU82.2268.29BBH77.8271.36MATH4832.66HUMANEVAL71.9551.22GPQA37.8831.31可以看出从 InternLM2-20B 到 InternLM2.5-20B知识问答MMLU/CMMLU、数学MATH、代码HUMANEVAL与科学推理GPQA等维度均有明显进步其中 MATH 提升约 15 个点、HUMANEVAL 提升约 20 个点推理与编码能力是本次升级的重中之重。4.2 对话模型与 Gemma2-27B-IT 的同场对照BenchmarkInternLM2.5-20B-ChatGemma2-27B-ITMMLU (5-shot)73.575.0CMMLU (5-shot)79.763.3BBH (3-shot CoT)76.371.5MATH (0-shot CoT)64.750.1GPQA (0-shot)33.329.3在中文知识CMMLU、推理BBH、数学MATH与科学问答GPQA四项上InternLM2.5-20B-Chat 均超过 Gemma2-27B-IT尽管后者参数量更大27B仅在英文通识 MMLU 上略低73.5 vs 75.0。4.3 评测口径说明模型卡对评测方法给出三点重要注记使用时需留意基座模型的选择题MCQ评测采用ppl困惑度指标。评测结果由 OpenCompass 获得对应评测配置可在 OpenCompass 提供的配置文件config 文件中找到。由于 OpenCompass 版本迭代评测数据可能存在数值差异应以 OpenCompass 最新评测结果为准。标注*的结果表示引自原论文。五、从源码验证模型实测路径与工具调用链路5.1 测试用例覆盖仓库 tests/test_hf_model.py 是验证 20B 模型可用性的直接证据TestBase.test_demo_default将internlm/internlm2_5-20b列入基座模型参数化列表加载后对[你好, whats your name]等提示词执行model.generate并通过assert_model校验输出非空且不含异常拼接文本如UNUSED_TOKEN、Mynameis。TestChat.test_demo_default将internlm/internlm2_5-20b-chat列入对话模型参数化列表同时覆盖use_fastTrue/False两种分词器加载方式并分别验证了model.chat单次对话与model.stream_chat流式对话两条调用路径。这从测试层面确认20B 基座与 Chat 模型均可通过 HFtrust_remote_code接口在 Transformers 生态中直接加载推理。5.2 工具调用与 Agent 链路模型卡提到的更强工具使用能力在仓库中有完整的配套实现agent/lagent.md 给出了基于Lagent框架、以 InternLM2.5-Chat 为 LLM 构建 ReAct Agent 的完整示例初始化HFTransformer(internlm/internlm2_5-7b-chat)作为语言模型绑定GoogleSearch与PythonInterpreter工具再交由ReActAgent 编排执行。agent/README.md 进一步展示了 InternLM2.5-Chat 结合代码解释器在 MATH 上的实测结果InternLM2.5-7B-Chat 配工具后 MATH 达 63.0对比 InternLM2-Chat-20B 配工具的 51.2、gpt-4-0125-preview 无工具的 64.2并提供了 streaming_inference.py 脚本用于在 MATH 测试集上复现推理与评测。chat/chat_format.md 则从模型侧解释了工具调用的协议基础InternLM2-Chat 采用类 ChatML 的对话格式并额外引入environment角色通过name|plugin|与name|interpreter|区分普通工具与代码解释器的系统提示词模型以|action_start|/|action_end|边界输出 JSON 格式的调用参数环境返回结果后再封装为environment角色的消息。六、部署与使用实践6.1 环境要求参照仓库 README.md 的 RequirementsPython 3.8PyTorch 1.12.0推荐 2.0.0 及以上Transformers 4.386.2 Transformers 加载与对话以 HF 格式加载 InternLM2.5-20B 系模型基座与 Chat 均适用import torch from transformers import AutoTokenizer, AutoModelForCausalLM model_dir internlm/internlm2_5-20b-chat # 基座模型为 internlm/internlm2_5-20b tokenizer AutoTokenizer.from_pretrained(model_dir, trust_remote_codeTrue) # 以 float16 加载以避免默认 float32 导致显存不足OOM model AutoModelForCausalLM.from_pretrained( model_dir, trust_remote_codeTrue, torch_dtypetorch.float16) model model.eval() response, history model.chat(tokenizer, 你好, history[]) print(response)基座模型可直接使用model.generate参数参考 tests/test_hf_model.py 中的gen_kwargsmax_length128, top_p10, temperature1.0, do_sampleTrue, repetition_penalty1.0Chat 模型则推荐使用model.chat或流式的model.stream_chat。6.3 LMDeploy离线批推理与在线服务仓库 chat/lmdeploy.md 提供了基于 LMDeploy 的高效推理方案pip install lmdeploy0.2.1from lmdeploy import pipeline pipe pipeline(internlm/internlm2_5-20b-chat) response pipe([Hi, pls intro yourself, Shanghai is]) print(response)如需扩展上下文长度例如 200K可通过TurbomindEngineConfig启用动态 NTKfrom lmdeploy import pipeline, TurbomindEngineConfig, GenerationConfig engine_config TurbomindEngineConfig(session_len200000, rope_scaling_factor2.0) pipe pipeline(internlm/internlm2_5-20b-chat, backend_engineengine_config) gen_config GenerationConfig(top_p0.8, top_k40, temperature0.8, max_new_tokens1024) response pipe(prompt, gen_configgen_config)启动 OpenAI 兼容的 RESTful 服务只需一行命令默认端口23333lmdeploy serve api_server internlm/internlm2_5-20b-chat lmdeploy serve api_client http://0.0.0.0:23333服务启动后既可用api_client在终端交互也可通过http://0.0.0.0:23333的 Swagger UI 直接调试 API。七、局限性与使用须知模型卡强调尽管训练过程中已尽力保障模型安全性、引导模型生成符合伦理与法律要求的文本但受限于模型规模与概率化生成范式模型仍可能输出意料之外的内容——例如包含偏见、歧视或其他有害信息。请勿传播此类内容因有害信息扩散产生的任何后果官方不承担责任。此外模型卡对基座与 Chat 版本的定位差异需要留意基座模型未经对话对齐直接生成对话式内容的能力有限实际产品开发应选用 InternLM2.5-20B-Chat并通过 chat_format.md 描述的system/user/assistant/environment四角色格式组织多轮对话与工具调用。八、总结InternLM2.5-20B 是 InternLM2.5 系列中能力最强的一档基座模型在知识、数学、代码与推理上全面超越上一代 InternLM2-20BChat 版本经 SFT 与在线 RLHF 对齐后在中文知识与数学推理上达到超越 Gemma2-27B-IT 的水平并具备面向多网页检索与工具调用的强化能力。无论你是要评估模型选型、复现基准评测还是基于 Agent 示例 与 LMDeploy 指南 搭建应用本文梳理的模型卡内容、源码证据与部署路径都已给出可直接照做的完整参考。赞分享大模型人工智能基础模型AI Agent【免费下载链接】InternLMOfficial release of InternLM series (InternLM, InternLM2, InternLM2.5, InternLM3).项目地址https://gitcode.com/gh_mirrors/in/InternLM点击查看免费下载相关推荐InternLM2.5系列模型深度评测与应用实践InternLM2.5系列模型深度评测与应用实践 本文深度评测了InternLM2.5系列大语言模型涵盖1.8B、7B和20B三个参数规模版本。文章详细分析了大模型人工智能基础模型AI AgentInternLM2.5-7B大语言模型深度解析与评测InternLM2.5 7B大语言模型深度解析与评测 模型概述 InternLM2.5 7B是InternLM系列模型的第二代升级版本包含70亿参数规模的基础大模型人工智能基础模型AI AgentInternLM2.5-7B 模型全解析版本选型、性能基准与推理部署实战指南InternLM2.5 7B 模型全解析版本选型、性能基准与推理部署实战指南 导读 本篇指南围绕 InternLM2.5 7B 模型卡片 https://li大模型人工智能基础模型AI Agent上一篇Streamline.js高级特性Futures并行处理与性能优化指南下一篇告别Excel用Mermaid.js构建铁路系统智能调度可视化平台创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考