
前OpenAI研究员看空大模型公司Dwarkesh发文反驳AGI会自己找工作最近关于“大模型公司到底值不值钱”的争论又起了一轮。一边是前OpenAI研究员公开表示看空大模型创业公司认为模型能力会被开源社区和巨头快速抹平API价格战会烧掉大部分利润空间指望靠“卖模型”赚钱的公司大概率活不到AGI落地的那一天。另一边是Dwarkesh发文反驳核心观点很直接如果AGI真的出现它不会像应届毕业生一样蹲在公司门口等Offer而是会自己去找工作、自己接任务、自己完成交付真正值钱的不是模型本身而是能让模型自主运转的“工作链路”。这轮争论看起来是宏观叙事但落到今天的技术栈上其实和每个做大模型应用、本地部署、API集成的人都有关系模型能力决定上限交付链路决定价值。这篇文章不站队只做三件事拆解双方的核心逻辑看哪一部分已经被现实验证哪一部分还属于假设。把争论转译成技术判断维度Token成本、开源替代、Agent链路、本地部署、API接口、批量任务。给开发者和企业一个可落地的观察框架不用等到AGI出现现在就能用“最小可运行实验”去验证哪边更接近事实。1. 核心争议速览维度看空方观点反方观点模型本身的价值会被开源和巨头快速同质化模型只是起点价值在模型之上的自主工作能力大模型公司的护城河API价格战token成本持续下降数据飞轮、用户习惯、Agent生态AGI的形态更像一个待调用的工具更像一个会自己找活干的智能体对开发者的启示别把业务押注在单一模型上提前设计模型调度、任务编排和反馈闭环当前可验证信号开源模型推理成本下降Agent框架、MCP协议、多模态接口成熟从材料看这场争论适合所有关注LLM应用落地、API成本管理和大模型选型的读者。2. 前OpenAI研究员的“看空逻辑”为什么大模型公司被质疑先还原看空方的核心论点它并不是“AI没用”而是“卖模型的公司未必有价值”。2.1 API价格战会压缩利润空间现在主流大模型API的调用价格已经进入快速下降通道。无论是头部厂商还是开源模型的服务商每百万token的推理成本都在持续走低。对创业公司来说如果商业模式是“转售模型能力”毛利率会被上下游一起挤压上游模型迭代更快下游客户对价格更敏感。这带来一个直接后果如果你的产品只是包了一层Prompt没有自己的数据、工作流和交付标准客户分分钟会换成更便宜的模型。2.2 开源模型不断抹平能力差距当前开源大模型已经从“能用”进化到“好用”。配合Ollama、vLLM、llama.cpp这类推理框架团队在普通GPU服务器甚至消费级显卡上就能跑起一个可用的私有大模型。这意味着什么意味着模型本身的稀缺性在下降。从本地部署角度看企业完全可以用Ollama部署私有大模型做内部知识库问答用LoRA微调适配垂直领域用量化版本降低显存门槛把敏感数据留在内网不经过任何外部API。当这成为常态“模型能力”就从核心资产变成了基础设施。基础设施的特点是门槛越来越低利润越来越薄。2.3 模型交付不等于业务交付看空方还有一个很实际的观察客户不会为一个“能写文章、能写代码”的模型长期付费客户只会为“解决某个具体问题”的结果付费。模型只是中间件业务价值在最后的交付物里。这也是很多大模型创业公司估值被打折的原因融资故事讲的是AGI实际收入却要靠一个个项目定制、一条条Prompt调优、一次次数据清洗来挣。这种生意和传统软件外包的利润率差不多却要承担大模型研发的高成本。3. Dwarkesh的反驳AGI为什么不是“失业的毕业生”Dwarkesh的回应值得细看。他没有否认模型会同质化也没有否认API价格会下降而是换了一个问题如果AGI真的出现它会不会自己寻找工作3.1 “能做任务”不等于“能找到任务”当前的LLM本质上是一个“任务执行器”你给它一个明确的Prompt它给出对应的输出。它不会自己发现“我的代码仓库有个安全漏洞”更不会主动说“用户需求变了我应该调整方案”。但在智能体的演进方向上模型正在从“被调用”走向“自主行动”。通过工具调用、外部API、环境反馈和长期记忆AI系统已经可以自主规划多步任务调用搜索引擎、代码解释器、外部服务根据执行结果修正下一步动作在失败时重试或者更换方案。一旦模型具备了“寻找任务”的能力它就不再是等着人类写Prompt的工具而是会主动进入工作流把“找活干”这件事本身变成AI的职能。3.2 大模型公司的价值从“模型”转向“工作链路”Dwarkesh的反驳核心在于就算模型本身免费了让模型“自己找到工作并干完”的那套系统仍然稀缺。这套系统包含任务描述与拆解机制工具调用协议和权限边界环境感知与记忆管理结果校验与人工兜底批量任务调度和并发控制。这些能力不是模型参数能直接给的它们属于工程、产品、数据和安全领域。换句话说AGI时代最值钱的不是会思考的“大脑”而是能让大脑接入社会生产体系的“手脚、简历和社交网络”。3.3 这个观点对普通开发者有什么参考把视角拉回今天你在做的本地大模型部署、API集成、批量任务脚本本质上就是在为“模型自己找工作”铺路。你已经不再把模型当成一个聊天框而是在教它如何读取文件如何调用工具如何根据结果调整策略如何把输出写回某个系统。这恰恰是Dwarkesh所说“自主工作能力”的雏形。哪怕现在只是命令行工具、是一个自动化脚本方向已经踩在关键路径上。4. 从部署视角看“大模型公司价值”的三个验证信号争论归争论做技术的人更关心哪些信号是真实的哪些信号只是叙事这里给出三个可验证的方向。4.1 推理成本下降是否比模型能力迭代更快如果你在长期调用某个大模型API建议每季度记录一次每百万token的输入/输出价格同等效果下的替代模型选择开源模型在本地跑出同等效果所需的硬件成本。做一个简单的成本曲线。如果价格下降速度远超过能力提升速度说明“模型能力作为商品”的空间确实在被压缩。这时候应该把更多精力放在应用层而不是继续等待下一个更强的模型。4.2 开源模型能否覆盖你的真实业务场景很多团队对开源模型的态度是“测试可以上线不敢”。但过去一年情况已经在变化场景开源模型可用性主要障碍通用对话较成熟量化后可本地跑长文本稳定性、幻觉控制代码生成可用需配合检索补充上下文复杂工程任务仍需微调结构化抽取可结合Pydantic等工具输出格式规范需要额外约束多模态识别可用显存要求高高精度场景仍弱于头部闭源批量离线任务较适合成本低推理速度需GPU集群支撑真正建议的做法是选三类核心业务场景分别用开源模型和商用API做A/B测试。比指标也比综合成本。你会发现很多“非用API不可”的理由其实是基于一年前的刻板印象。4.3 模型能力是否正在从“生成”转向“行动”这是判断AGI叙事是否靠谱的关键。可以留意几个方向的进展模型是否更擅长使用工具而不是单纯生成文本是否有成熟的函数调用与结构化输出接口是否支持多轮自我纠错是否有长期记忆和用户偏好管理是否有Agent编排框架和可观测性支持。如果这些能力在持续完善说明“AGI自己找工作”不再只是哲学讨论而是一个工程问题如何让模型稳定地、安全地、大规模地执行任务。这恰恰是当前大模型应用开发的重点也是最缺人才和最有壁垒的地方。5. 如果AGI真的会“自己找工作”基础设施需要长什么样把争论向前推一步。假设AGI真的能做到“自己找工作”那么当前的技术栈需要补上哪些能力这决定了谁会在下一轮胜出。5.1 任务来源接口模型怎么知道有什么活人类找工作靠招聘网站和社交网络。AI找工作需要的是任务分发接口。现在这部分正在被标准化MCPModel Context Protocol让模型能够发现并访问外部工具API网关提供统一的鉴权、限流和计量消息队列支持异步任务投递和结果回调事件系统让模型能够监听业务状态变化。从实现角度看如果你正在设计一个AI落地系统建议把“任务输入”和“任务执行”解耦。不要让模型直接读数据库、直接写生产环境而是通过标准接口接收任务通过权限边界控制动作范围通过审计日志记录每一次调用。5.2 执行链路工具调用和权限控制模型自己找活干不等于模型可以为所欲为。真正可落地的Agent系统必须同时具备工具注册中心模型能发现有哪些工具可用参数校验层过滤非法输入和危险操作审批机制高风险动作必须人工确认失败回退调用失败时能选择降级方案。这里给一个通用的Agent工具调用伪配置示例tools [ { name: search_knowledge_base, description: 在内部知识库中搜索相关文档, parameters: { query: {type: string, required: True} }, permission: read_only }, { name: create_ticket, description: 创建工单并分配给处理人, parameters: { title: {type: string, required: True}, priority: {type: string, enum: [low, medium, high]} }, permission: needs_approval } ]这个设计对应的是“模型自己发现活、自己决定怎么做、关键动作仍然受控”的工程思路。5.3 结果反馈模型怎么知道自己干得好不好自主系统必须有闭环反馈。否则模型会一遍遍重复同样错误无法收敛到可接受质量。可借鉴的方案给每个Agent任务分配唯一ID记录完整执行轨迹对输出结果做自动校验器如规则检查、格式校验、语义相似度对失败任务做分类归因支持人工标注结果回流到Prompt或微调数据中。从“找工作”的角度看这相当于给AI准备了一套“工作评价体系”。没有这套体系AI只能是“自说自话地干活”离真正的生产力工具还很远。6. 大模型公司的商业模式观察从API到Agent平台回到大模型公司本身。如果模型同质化不可避免那么公司的收入结构一定会从API调用费转向更高层的产品化能力。6.1 API模式薄利多销绑定生态单纯卖API的模式长期看会像云计算一样变成重资产、低毛利的生意。头部厂商会继续做因为API是数据回流和生态绑定的入口但中小创业公司想靠API差价赚钱越来越难。6.2 订阅模式把模型包装成“办事员”相比按token计费按席位、按任务数、按自动化流程数收费更接近“AI员工”的定价逻辑。用户买的不是模型能力而是“多了一个能干活的下属”。这种模式的关键在于能否让任务真正跑通而不是让用户自己调Prompt。6.3 Agent平台模式收“中介费”如果AGI真的会自己找工作那么下一轮最有价值的平台可能是“AI工作任务市场”企业发布任务需求AI系统自动拆解、匹配工具和模型交付结果后自动计费多模型调度选最划算的模型完成每个子任务。这种模式下的关键指标不再是模型Benchmark而是任务完成率、单位任务成本和用户复购率。7. 给开发者和企业主的落地建议不预测未来只给当下可操作的判断方法和行动建议。7.1 不要为了“AGI”押注单一技术路线无论你是喜欢闭源API还是开源本地部署都不要把全部业务绑在单一模型或单一厂家上。更合理的策略是层建议模型层保留2-3个可切换的模型供应商本地部署一个开源模型兜底应用层抽象模型接口通过配置切换不要硬编码模型名数据层建立数据回流和评估集持续监控模型质量漂移工程层用API网关统一鉴权、计量和日志方便做成本分析7.2 先跑通“最小自主工作链路”不用等AGI出现。现在就可以选一个真实业务场景搭建最小链路。比如做一个“自动周报生成器”输入数据库查询结果、日志文件、工单列表处理调用大模型总结核心变化工具自动读取数据、生成图表、输出Markdown推送调用企业微信或邮件API发送报告反馈人工评价报告质量记录到数据库。这条链路并不复杂但它包含了“自主执行”的全部要素任务来源、工具调用、结果交付、反馈闭环。把它跑通你就能直观感受到模型能力之外工程链路的价值到底有多大。7.3 用API成本模拟器做预算如果团队正在规划Agent类产品建议先做一轮成本模拟# 成本模拟示例按实际任务量调整 daily_tasks 10000 prompt_tokens_per_task 2000 completion_tokens_per_task 1000 price_input_per_million 1.5 price_output_per_million 6.0 input_cost daily_tasks * prompt_tokens_per_task / 1e6 * price_input_per_million output_cost daily_tasks * completion_tokens_per_task / 1e6 * price_output_per_million monthly_cost (input_cost output_cost) * 30 print(f预计月成本: ${monthly_cost:.2f})这个计算能帮助你判断这个功能到底能不能商业化。如果单次任务成本太高你就需要做模型裁剪、缓存、本地小模型前置过滤等优化。8. 常见认知误区与排查方法这场争论里两边都有容易误导人的地方。这里用“误区-事实-排查方式”的方式整理一下。常见误区更接近事实的判断如何验证“模型会免费所以AI创业没戏”模型免费不代表交付免费尝试搭建一条完整业务链路看人力成本占多少“AGI会自己找工作所以现在做Agent就稳赢”自主能力还远不成熟做100个真实任务统计成功率、失败原因、人工介入次数“API价格下降应用成本一定下降”质量要求提升复杂任务的token用量会增长对比半年前和现在的单任务成本不只对比单价“开源模型能力跟不上”细分场景下开源已可用用你自己的数据做A/B测试不要只看公开Benchmark“本地部署一定更省钱”硬件、运维、调优成本不低计算GPU折旧、电费、人力维护成本再与API对比9. 最佳实践怎么跟踪这轮争论而不被带偏作为技术人看这类文章的目的不是站队而是提炼可迁移的判断框架。9.1 建立自己的“模型能力月度体检”每个月做三件事用一个固定测试集跑一遍你正在用的模型记录价格、延迟、成功率、输出质量对比开源模型在同等任务上的表现。这样你对“模型能力是否同质化”“公司是否还有壁垒”会形成自己的判断而不是被某篇推文带动情绪。9.2 关注工程层信号而非叙事层信号少关注“某某公司估值多少”这类新闻多关注开源社区提交频率Agent工具的标准化进度推理框架对显存和延迟的优化企业级模型API的稳定性SLA。这些才是影响你项目招投标、技术选型和成本结构的关键。9.3 给自己留“模型无关”的接口稳妥的工程架构会让模型变成可替换组件。无论未来是闭源统治还是开源遍地你的应用层都能平滑迁移。一种模型无关的接口抽象示例class LLMBackend: def generate(self, prompt: str, system: str ) - str: raise NotImplementedError class OpenAICompatBackend(LLMBackend): def __init__(self, base_url: str, api_key: str, model: str): self.base_url base_url self.api_key api_key self.model model def generate(self, prompt: str, system: str ) - str: import requests response requests.post( f{self.base_url}/chat/completions, headers{Authorization: fBearer {self.api_key}}, json{ model: self.model, messages: [ {role: system, content: system}, {role: user, content: prompt} ] }, timeout60 ) response.raise_for_status() return response.json()[choices][0][message][content]只要后端兼容OpenAI协议你就可以在不同模型、不同部署方式之间切换。这就是“预测不确定时保持架构可替换”的基本功。10. 总结与下一步这场争论最值得关注的不是谁对谁错而是双方其实都承认了一个趋势模型能力本身会越来越像基础设施。看空方提醒的是不要以为“我有一个模型”就等于“我有一个公司”真正能收钱的业务必须做到垂直、自动化和可交付。反方提醒的是当模型真的能自己找工作时最大的价值不会停留在模型层而是长在任务分发、工具生态、交付闭环和评价体系上。对你来说第一步不是押注某一个结论而是把手头最重复、最规则化的工作流程尝试改造成一条AI可执行的最小链路。无论是本地部署一个开源模型还是调用API做批量任务先让机器跑通一个真实业务闭环。跑通之后再看成本、看质量、看人工介入率这时候你对“大模型公司值不值钱”的判断会比任何一篇文章都可靠。如果你近期也在做大模型选型、API成本控制或Agent链路搭建建议把这篇文章里提到的验证方法做成自己的检查清单每个月过一遍。模型迭代很快价格变化更快只有持续跟踪才不会被一两篇观点文带偏节奏。