
9月这份大模型排行榜又更新了。据博客园等平台整理的 AIHOT 榜单30 款在榜模型里第一名是 Meta 9 月 2 日上线的 Muse Spark 1.3发布三天就冲到榜首OpenAI 9 月 3 日发布的 GPT-6 Astra 排第二国产的 Kimi K3、GLM-5.3 分别排第 6 和第 8。我把这份榜单里对开发者和普通打工人实际有用的部分拆一下。这份榜单里变的是什么节奏明显变快了。据该榜单统计Meta 一年发了三代1.1、1.2、1.3Google 的 Flash 系列基本两三个月一更OpenAI 则是用一个 GPT-6 带着一串 5.x 变体铺满中间的段位。也就是说榜首三个月换一次人已经不算新闻模型更新的周期从按年变成了按月。上下文窗口卷到了百万 token 起步。报道称前 30 名里一大半都是 100 万 token 级其中 GLM-5.3 标称 131 万 token是榜单里最大的一档。两三年前还在讨论 32K 够不够用现在百万上下文已经成了旗舰的入场券。价格差依然是真实存在的鸿沟。据报道GPT-6 Astra 的 API 定价是输入 10 美元、输出 50 美元每百万 token。而国产的同档模型价格普遍只有海外同类的几分之一。对个人开发者和小团队来说这个差距比排名第一还是第五重要得多。没变的是什么榜单只反映综合评测的相对位次不反映你的具体场景。写代码、跑 agent、写中文内容、做长文档总结各家强项不一样。榜单第一名不代表在你手里最好用。跑分高和用得多是两回事。举个旁证据开源中国等平台报道上半年真实用量层面DeepSeek V4 Flash 曾以单周 5.36T token 领跑。榜首是榜单给的用量是用户用脚投票投出来的两者经常对不上。架构层面也没有颠覆性变化。这一代模型的进步主要还是靠更大的上下文、更强的推理与工具调用能力、以及更细的变体切分同一个底座拆出不同档位覆盖不同负载并没有跳出更大参数 更多数据 更好的对齐这条主线。对普通开发者意味着什么几个比较实在的建议别只盯第一名选型。先列出你真正的任务类型代码补全、长文总结、结构化抽取、agent 工具调用再去匹配模型的长板而不是看总榜。做分层调用。简单的活分类、改写、格式转换交给便宜的小模型难的活复杂推理、长链工具调用再上旗舰。成本能差一个数量级。上下文大 ≠ 能全部用上。百万 token 窗口是能力上限不代表模型对中间部分的信息记得住。实践里常见的做法是关键信息放开头或结尾中间塞次要材料。注意计费方式。输入和输出是分开计价的输出通常贵得多长上下文意味着每次调用的输入都可能很长账单容易失控。上线前一定先用真实数据压一遍成本。代码上把模型名、服务地址做成配置换模型只改一行是最省事的做法# 依赖pip install openai# 通用示例OpenAI 兼容接口model/endpoint 做成配置换模型只改一行fromopenaiimportOpenAI clientOpenAI(base_urlhttps://你的服务地址/v1,api_key你的KEY)respclient.chat.completions.create(model主力模型,# 换模型只改这里messages[{role:system,content:你是代码助手只回答技术问题。},{role:user,content:解释一下数据库索引为什么常用 B 树},],)print(resp.choices[0].message.content)把这类调用包一层记录每次的 token 消耗和耗时跑一段时间后你自然会知道哪个任务该用哪个模型比看榜单靠谱。收个尾榜单每个月都会变但选型的逻辑其实没怎么变按场景、按成本、按可用性三者取平衡。榜单可以拿来看趋势不适合拿来直接做技术决策。你现在的项目主要用哪家模型当初选它的理由是什么评论区聊聊。