
Qwen-Agent 本地部署实操LM Studio 接入全流程与避坑【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent会议室的 WiFi 一断云端 API 就卡住客户当场要求演示 Agent 问答。如果每条消息都要走云这一刻会很尴尬。本文用 LM Studio 完成 Qwen-Agent 本地部署本地模型走 OpenAI 兼容协议断网时 Agent 照常工作。为什么是本地模型 OpenAI 兼容接口LM Studio 是图形化推理程序能把量化模型加载到你的机器上并在默认 1234 端口起一个 OpenAI 兼容服务即请求格式模仿 OpenAI 的 HTTP 接口大多数客户端改个地址就能用。Qwen-Agent 不绑定任何厂商llm 抽象基类 定义统一聊天接口oai 适配器 从配置读取 base_url 说 OpenAI 协议把地址指到 localhost:1234 即可不用改代码。函数调用同样走 function_calling 实现模型按结构化格式输出函数名和参数框架在本地执行。对比一下为什么选它而不是云 API对比项本地部署LM Studio云端 API数据去向留在你的机器发到云厂商服务器首字延迟取决于硬件通常几秒内受网络影响约 0.5~3 秒成本一次显存投入调用不限次按 token 计费演示多了费用累积动手实操把第一条回复跑出来整条链路是备环境、起服务、指配置、做验证每节都是下一节的前提。环境准备框架与 Python 依赖需要 Python 3.10 及以上。克隆仓库并本地安装框架git clone https://gitcode.com/GitHub_Trending/qw/Qwen-Agent cd Qwen-Agent pip install .加载模型启动 1234 端口的服务 ️在 LM Studio 的模型页搜 Qwen2.5-7B-InstructGGUF下载 4-bit 量化版。GGUF 是面向消费级硬件的量化文件格式量化就是压缩权重省显存8GB 显存选 7B 加 4-bit 是稳妥起点16GB 以上可以上 13B。到 Server 页保持默认端口 1234点 Start Server。在终端确认服务活着curl http://localhost:1234/v1/models返回带模型名的 JSON服务就是好的。把 Agent 配置指到 1234核心是一个 llm_cfg 字典。model 不是随意的市场名要和 LM Studio 里加载的名字一致也就是 /v1/models 响应里的那个名字。model_type 取 oai这是 oai 适配器注册的别名model_server 填服务地址。api_key LM Studio 不校验随便给个非空串llm_cfg { model: qwen2.5-7b-instruct, # 与 LM Studio 中加载的名字一致 model_type: oai, model_server: http://localhost:1234/v1, api_key: lm-studio, }本地模型爱啰嗦可以给字典加 generate_cfg设 max_new_tokens: 2048、temperature: 0.7适配器会原样透传给本地服务。最小验证先跑通一轮对话from qwen_agent.agents import Assistant bot Assistant(llmllm_cfg) for out in bot.run([用一句话介绍 Qwen-Agent。]): print(out)看到流式回复本地部署就跑通了。若报连接错误直接看文末的排查表。对话之外两个拿来就用的工作流本地模型不只是聊天。框架的内置工具让 Agent 能真正在本地干活。最轻的是代码解释器给 function_list 加 code_interpreter模型需要计算或画图时会写 Python框架在你机器上执行并读回结果。比如把销售表格算出环比增速并画折线图整条链路不依赖外部服务。第二个是文档问答构造 Assistant 时把 PDF 路径传给 files 参数框架用内置解析器 simple_doc_parser.py 把文档切片模型基于本地切片回答。合同、规格书、会议纪要都能直接问文本不出你的机器。避坑排查现象与处理对照 ️现象处理连接被拒绝curl 或 Agent 报错确认 LM Studio 的 Server 页处于 Start 状态确认 1234 端口没被防火墙拦先单独 curl 验证请求返回 404、找不到模型配置里的模型名和 LM Studio 加载的名字不一致从 /v1/models 响应里原样拷贝名字端口已被占用在 LM Studio 里换服务端口如 1235同步修改 model_server生成慢每秒只有几个 token7B 加 4-bit 已是 8GB 显存基线先缩短 max_new_tokens再考虑换 3B 模型Agent 不调工具、直接输出文本换用 Qwen3 等工具调用支持好的指令模型核对输出格式能被内置解析器解析这个方案适合谁适合私有演示、文档问答和中小内网团队要多模态理解或高并发服务仍建议走云端 API 或 vLLM 服务。细节看仓库 README 与 examples 目录。【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考