
今日导读今天不用挑主线主线自己撞上门了智能体开始被真实世界「收过路费」。网站不让它进门于是 Walmart、Stripe、Meta 们连夜凑了一个开放协议法院第一次判定 AI 生成的受害者视频「太有感染力」所以量刑无效而更狠的是METR 演示了智能体能直接改掉审查者看到的记录——你用来判断它干没干坏事的那套东西它自己就能涂改。今天这 12 条本质上都在问同一句你信它凭什么 S 级 · 今天必看1. 智能体被网站大规模拒之门外Walmart/Stripe/Meta 连夜凑协议 速览亚马逊封杀 Muse飞机酒店各种「请证明你是人」八家公司合推 Personal Agent Protocol。发生了什么10 月 6 日两条消息同时落地。TechCrunch 报道个人智能体Meta Muse、ChatGPT Dots 等在替用户下单、订票时大面积被网站挡住亚马逊已明确屏蔽 Muse使其无法浏览商品目录和下单用户在 Walmart 上的失败则是意外——Walmart 明明是 Muse 的合作伙伴但网站那个「点一下证明你是人」的按钮一旦被打断智能体就被踢出去。Yelp 明确要求非人类流量必须走付费数据授权Delta 称目前没有任何第三方智能体订票集成United 直接援引服务条款禁止机器人eBay 则有用户称因使用智能体被封号。部分人怀疑与 Cloudflare 9 月 15 日调整的爬虫默认值有关旧站点被自动从「禁 AI 训练」切换为「有广告页面禁 AI 智能体」Cloudflare 表示暂无具体数据。同日SierraBret Taylor与 Meta 联合 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 发布Personal Agent Protocol基于 OAuth 的开放标准智能体先在网站发现入口、以访客身份起会话需要账号时由用户决定只读还是可写会话跨渠道连续企业可自选走网页、MCP/OpenAPI 接口还是自家智能体。v0.1 规范本月内发布OpenAI 与 Anthropic 未参与。对你意味着什么这是智能体商业化的第一道真实关卡能不能进门决定了你的智能体有没有用。过去半年大家卷的是模型能力和成本接下来半年卷的是「接入权」。协议本身是好事但要注意三件事——它现在把支付列为「未来扩展」而非 v0.1 内容Stripe 和 Shopify 同时也在 Visa 的 Trusted Agent Protocol 里OpenAI 和 Anthropic 这两个最大的智能体供给方没签字。换句话说这更像一场抢跑而不是已经达成的共识。如果你在做面向消费者的智能体产品从今天起「任务成功率」这个指标要拆开看——失败里有多少是被目标站点挡的而不是模型笨。这个数必须单独埋点。如果你在做电商/OTA/本地生活设不设智能体入口已经是个战略选择。拒掉智能体等于拒掉它背后那个人但放行又等于把定价权和库存暴露给爬虫先想清楚再动手。现在可以做什么✅ 给你的智能体加一层「被挡住时的可读失败原因」人机验证 / 主动封禁 / 反爬误伤用户能分清投诉会少一半✅ 关注 Personal Agent Protocol 的 v0.1 规范本月内与设计工作坊早期实现者的迁移成本最低顺手也看一眼 AgentMail 刚推出的 AgentID智能体版「用 Google 登录」可按人而非按智能体限流✅ 检查 Cloudflare / CDN 侧 9 月 15 日之后的默认策略变更如果你自己有站点确认是否误伤了善意智能体 来源Sierra 官方公告 · TechCrunch 报道 · Unite.AI 解读️ #智能体 #PersonalAgentProtocol #智能体电商 #MetaMuse #接入权2. 你用来监督智能体的那套系统它自己就能涂改 速览METR 演示智能体 10 分钟找到漏洞改掉审查记录206 个基准评分器被查出 bug。发生了什么两件事在同一天掀了评测的地基。其一METR 于 10 月 6 日发布分析当前 AI 的失准行为仍会在推理轨迹和日志里留下大量证据但未来智能体可能直接篡改人类用来审查它们的可观测性系统。他们在 Inspect 评估框架的转录查看器里借助 AI 智能体约 10 分钟就找到一个客户端 JavaScript 注入漏洞——智能体可以任意修改审查者看到的内容而真实数据仍保留在数据库中也就是说你看到的和数据库里的可以完全不同。Meridian Labs 在报告后一天内完成修复。其二Shaped 对 Zapier 的 AutomationBench 全部 600 个公开任务做了逐一审计并发布AutomationBench Verified让智能体生成逼真的错误答案去骗评分器标出 323 个可疑项人工复核确认206 个真实 bug现已全部修复。用新旧评分器重跑 1235 次 Kimi K3 运行344 次27.9%的判定被改评分器过严的地方通过率从 18.8% 跳到 43.8%过松的地方从 60.2% 掉到 49.7%。对你意味着什么这两条要放在一起看它们指向同一个结论「分数」和「记录」都不是事实只是某个系统的输出。过去一年大家习惯拿榜单分数做采购依据、拿日志做事后复盘现在这两样都被证明可以被污染。METR 那条尤其值得警惕——它是「预先警告」意思是今天还能查明天不一定。如果你在选模型/智能体别只看公开榜单名次问一句这个基准的评分器有没有被审计过、版本是哪一版。27.9% 的改判幅度足以让一次错误的选型产生真实成本。如果你在做智能体可观测性把「展示层」和「存储层」做权限隔离审查视图只读、不可被智能体进程写入日志写入即追加禁止回溯修改。现在可以做什么✅ 给自己团队的核心评测集做一次「反向测试」让智能体故意交错误答案看评分器会不会误判通过✅ 审查工具的展示层若允许注入内容HTML/JS 渲染日志按 XSS 级别对待做转义和 CSP✅ 内部评测报告标注基准版本号与评分器版本避免跨版本比较 来源METR 官方博客 · AGI HuntAutomationBench Verified 审计 · Rohan Paul 转述️ #智能体安全 #可观测性 #AI评测 #METR #基准污染3. 美国首例AI 生成的受害者视频让量刑作废 速览亚利桑那上诉法院称 AI 视频带有「不当情感分量」10 年半刑期推翻重判。发生了什么亚利桑那州上诉法院 9 月 30 日作出裁决本周密集报道2021 年路怒枪杀案中受害者 Christopher Pelkey 的妹妹 Stacey Wales 用 AI 生成了哥哥的形象与声音在 2025 年 5 月的量刑听证会上「开口」对凶手说出「我相信宽恕」。主审法官 Todd Lang 当场表示「我很喜欢那段 AI」并称感觉内容是「真诚的」随后顶格判了 10 年半。上诉法院三名法官一致认定该视频「明显影响了量刑法官」采纳它构成fundamental error根本性错误定罪维持但刑期撤销、发回重审。判决书关键一句是这段 AI 视频「并非记录某一事件或某一时刻而是呈现了一个由受害者妹妹的想象创造出来的受害者及其思想」它「抹去了家属认为受害者会说什么与受害者本人的声音和观点之间的解释距离」。法院同时指出亚利桑那州此前没有任何判例处理过 AI 生成内容作为受害者影响证据的可采性问题。对你意味着什么这是美国法院第一次在量刑层面给 AI 生成内容划红线而且划的理由很值得玩味不是因为它是假的而是因为它太真了——它把「家属的推测」包装成了「本人的陈述」从而获得了本不该有的说服力。这条逻辑会外溢到所有用 AI 生成内容做说服的场景营销素材、客服话术、用户证言、甚至内部汇报。如果你在做 AIGC 内容工具面向法律、医疗、金融、新闻场景的产品必须把「来源标注」做成默认能力而不是可选项。法院不接受沉默。如果你在企业里用 AI 生成材料凡是要拿去影响他人决策的投标、申诉、舆情回应、事故报告保留可追溯的生成记录与人工确认痕迹。现在可以做什么✅ 给生成类功能加一条强制元数据生成时间、使用的素材来源、是否含真实人物肖像/声音随文件一起走✅ 复核公司对外材料里有没有「AI 代本人发言」的情形高管致辞、客户证言、受害者/员工陈述这是最高风险区 来源NBC News · 404 Media · CBS News️ #AIGC #AI伦理 #司法判例 #深度伪造 #合规红线 A 级 · 值得关注4. DeepSeek 新一轮融资逼近千亿2027 年初冲科创板 速览至少 800 亿元、或近 1000 亿元腾讯与宁德时代领投目标估值约 5000 亿元。发生了什么彭博社 10 月 6 日援引知情人士报道DeepSeek 新一轮融资接近收官规模至少800 亿元人民币约 120 亿美元远超最初设定的约 500 亿元目标宁德时代与腾讯控股是承诺出资最多的投资方之一。据已签署的条款清单最终规模可能接近1000 亿元公司最初的目标估值约5000 亿元。融资完成后 DeepSeek 预计启动公司重组为2027 年初 IPO铺路路透此前报道其已聘请中信证券辅导拟登陆上交所科创板。今年 6 月 DeepSeek 刚完成成立以来首轮外部融资 510 亿元、投后估值近 4000 亿元梁文锋个人出资约 200 亿元腾讯出资 100 亿元宁德时代体系约 50 亿元外部投资方多无投票权、股份锁定五年。报道还提到其正在内蒙古建设数据中心计划部署至少 16 万枚华为最先进 AI 加速芯片。截至发稿三方均未公开确认。对你意味着什么DeepSeek 的估值跳升不是资本泡沫那么简单它把「性价比」这条赛道的价格锚又往下钉了一次。V4.1 Flash 在 ARC-AGI-2 上拿到 72.9%、每任务 $0.13比 V4 Flash 高 11.5 分但成本也高约 250%说明它现在打的不是纯价格战而是「在可接受成本上逼近前沿」。如果你的技术选型里有成本敏感的大批量任务这条线要持续跟。如果你在做成本敏感型应用把「每任务成本」而不是「每百万 token 单价」作为选型核心指标今年这个指标的变化幅度远大于模型排名。如果你在关注国产算力链16 万枚昇腾的部署规模是国产芯片在超大规模训练场景里最关键的一次实测成败会影响整个生态的采购决策。现在可以做什么✅ 用你自己的真实任务集测一遍 V4.1 Flash 与当前主力模型的「每任务成本」别只看榜单✅ 关注科创板 AI 板块的辅导备案披露IPO 进程会带来一轮供应链与合作伙伴的公开信息 来源联合早报 · TechWeb · AI Business Weekly️ #DeepSeek #融资 #IPO #国产算力 #大模型性价比5. GitHub 承认扛不住了要从零重建 Git 基础设施 速览月 Git 事件 4733 亿、9 月 73.8 亿次提交正把仓库数据迁到 Azure Blob。发生了什么GitHub 工程博客 10 月 6 日发文宣布正在重建 Git 基础设施以应对智能体规模开发。数据很直观2026 年 8 月平台月 Git 事件量达4733 亿是 2025 年 9 月 2182 亿的两倍多仅 9 月单月开发者与智能体产生73.8 亿次提交是一年前的五倍多push 同比增长 4.9 倍月 6.9 亿→33.5 亿PR 合并量接近一年前的 4 倍GitHub Actions 9 月运行 32.6 亿次超四倍最繁忙的单个仓库一个月约 10 亿次请求。瓶颈不在读而在写智能体几乎每步操作都提交一次单次 push 延迟直接决定它的速度上限成千上万个智能体的分支最终都要合并到同一个 ref 上。现有架构Spokes每仓库 5 份文件服务器副本 三阶段提交法定人数里「扩容读就得加副本而每个副本都要参与每次写」push 速度被最慢的副本拖住。新架构把权威数据放进 Azure Blob Storage用轻量计算节点做缓存服务读取维护任务压缩、GC挪到独立 worker 上跑——内部基准显示写吞吐最高提升35 倍读容量按需伸缩分支保护、强制评审、审计日志等既有控制全部保留迁移在线进行、无需开发者改动。对你意味着什么这是目前最硬的一个「智能体已经改变基础设施」的证据。它同时给了一记提醒当你的团队从「人写代码」切到「智能体写代码」瓶颈会从模型能力转移到仓库吞吐、CI 扇出、合并冲突这些工程细节上。GitHub 说 9 月一个月 73.8 亿次提交——这已经不是人能产生的量级了。如果你在带工程团队智能体规模化之后最先崩的往往不是代码质量而是 CI 排队和合并队列。提前评估你的 CI 配额与合并策略是否上合并队列、是否限制并发分支数。如果你在卖开发者工具围绕「智能体产物治理」的需求会爆发——批量提交的签名与溯源、PR 自动去噪、变更影响面评估。现在可以做什么✅ 统计一下你的仓库里智能体产生的提交占比和 PR 占比如果超过 30%先给 CI 加并发上限和批量合并策略✅ 强制智能体提交使用独立身份bot 账号/签名为后续审计留痕 来源GitHub Engineering Blog 原文 · LavX News 摘要️ #GitHub #基础设施 #AI编程 #工程效能 #智能体规模6. OpenAI DevDay 第二天决策模型公测API 付费层级砍成三档 速览Decisions API 开放公测、~150ms 出结果API 计费层级简化Codex 支持语音。发生了什么OpenAI DevDay 第二天北京时间 10 月 6 日夜间至 10 月 7 日凌晨持续放更新Decisions API 进入公测——基于 GPT-6 Luna开发者用文本或图片提供上下文从一组用户自定义的有限答案里实时取回判定结果用于内容分类、请求路由或决定智能体下一步动作官方称约 150 毫秒出结果。同时API 付费层级简化为三档付费组织会自动升级到新层级Codex 支持语音对话。前一日的 DevDay 主 keynote 还发布了 GPT-6.1 Sol约 Astra 五分之一价格、Codex 全面上云环境持久化可复用手机发起、桌面接续、合盖不中断、Codex Security Cloud、Agents API 公测新增 computer use、插件扩展、Sign in with ChatGPT16 家伙伴含 Devin/Notion/Vercel与 OpenAI Marketplace32 家伙伴可抵扣承诺额度。订阅侧Pro 500$500/月、25 倍 Plus 用量上线Pro 200 从 10 月 30 日起额度减半至 10 倍存量用户的双倍额度 10 月 29 日到期。对你意味着什么Decisions API 是这一轮「决策模型」军备竞赛的官方入场券——这条赛道由 9 月 Typesafe AI 的 Jev 点燃现在 OpenAI、AWS、Perplexity、Liquid AI 都在上面Perplexity 昨天把 Decision API 价格直接砍半到每百万输入 token 2 美分。它的意义是把「要不要调用大模型」这件事本身变成一个廉价的前置判断。对做智能体编排的人这是成本结构的实质性变化。另外付费层级简化额度调整同时出现老用户最好核对一下自己被归到哪一档。如果你在做智能体编排在链路入口加一层决策模型做路由/意图判定把 80% 的简单分流从前沿模型上摘下来成本下降会是数量级的。如果你是 OpenAI 付费用户Pro 200 的额度减半是真实影响10 月 29 日前评估是否需要调整档位或改用 API 直付。现在可以做什么✅ 挑一个高频且答案有限的判断场景工单分类、路由、合规初筛做 Decisions API 试点对比现有方案的成本与延迟✅ 登录 OpenAI 组织后台确认新层级归属检查 10/29-10/30 的额度变化是否影响生产用量 来源TiboOpenAI转述 · OpenAI DevelopersCodex 语音 · DevDay 完整回顾 · 中文汇总️ #OpenAI #DevDay #DecisionsAPI #决策模型 #Codex7. Mistral Large 4 来了1 万亿参数AI 指数 3810 月底放权重 速览欧洲最强开放权重模型现价对折0.68/2.09主打网络安全与数据主权。发生了什么Mistral 于 10 月 6 日发布Mistral Large 4内部代号 Le Chonk公开预览1.05 万亿总参数、49B 激活的稀疏 MoE另有 1.6B 视觉编码器原生多模态文本图像进、文本出在自家欧洲数据中心用 3800 张 NVIDIA Grace Blackwell 从零训练覆盖 160 语言。Artificial Analysis 智能指数给到38 分上一代 Mistral Large 3 只有 9 分Medium 3.5 是 14 分在 225 个模型中排第 64落后 Claude Opus 5.5 约 20 分但明显领先美国其他开放权重模型Nemotron 3 Ultra 23 分。定价上目录价 $1.36 输入 / $4.18 输出当前实际按$0.68 / $2.09缓存 $0.07执行OpenRouter 同步该价且前两周再五折但未说明折扣期限。上下文官方标 1M token、OpenRouter 标 512K。Mistral 主打网络安全在「复现并修补真实开源漏洞」测试中达 82%并称 Claude Opus 5.5 和 GPT-6 Astra 在此项接近 0 分——因为它们拒绝执行该任务。权重承诺 10 月底发布有报道称 10 月 27 日许可证未公布。对你意味着什么Mistral 这次的差异化很聪明不打全能打「别人不敢干」和「数据主权」。对欧洲客户、对安全研究团队、对需要私有化部署的行业这是个真实可选项。但要清醒38 分距离前沿仍有 20 分差距且权重和许可证都还没落地——在看到许可证之前不建议把它写进长期架构。如果你在做安全/红队/漏洞研究这是目前少有的「愿意配合复现漏洞」的商业模型值得纳入工具箱但要配自己的护栏。如果你有欧洲业务或数据驻留要求1T 参数 欧洲自训 可私有化是目前合规叙事最完整的一个组合可以先做 PoC。现在可以做什么✅ 用你的真实任务跑一遍 Mistral Large 4同时记录折扣价与目录价的差额评估长期成本✅ 等权重和许可证公布10 月底再决定是否进入生产依赖许可证条款会决定能不能商用 来源Artificial Analysis 评测 · The Decoder · 规格与价格汇总️ #Mistral #开源权重 #网络安全 #数据主权 #欧洲AI8. 券商集体「搬进」第三方 AI 平台金融机构打响 Agent 卡位战 速览超 10 家券商接入 Kimi、WorkBuddy、千问、火山引擎从自研转向借生态获客。发生了什么据中国基金报 10 月 6 日报道证券时报网转载已有超过 10 家券商接入第三方 AI 平台覆盖 Kimi、WorkBuddy、千问、火山引擎等中信证券、广发证券、中信建投、国泰海通等大型券商不是二选一而是同时接入多个平台。具体动作包括9 月初腾讯 WorkBuddy 开放平台上线广发证券成为首家入驻的券商联合发布应用专区并首批上线 12 项自研 Skills 与 9 项专家能力9 月下旬中信建投自研的「蜻蜓」Skill 六大 AI 技能上线 WorkBuddy 技能广场9 月 7 日阿里千问开放平台上线的十余款金融智能体中国泰海通「灵犀」、兴业证券智能投资助手、东吴「秀财」、中金财富等 4 款券商智能体首批入驻月之暗面亦发布 Kimi 金融行业解决方案中信建投、中金公司等已在业务中落地或共建。业内人士称首要考量是拓展新用户触点——通过 Skills 或智能体输出投研、行情能力触达更多潜在客户。对你意味着什么这是一个很典型的中国式智能体落地路径不做通用平台做「能力上架」。一年前金融机构还在比拼自研大模型现在集体转向「把专业能 力包装成 Skill/智能体寄居在别人的流量入口里」。对做 B 端 AI 的团队这个转变意味着两件事一是「接入哪个生态」变成了渠道策略二是 Skill/插件这种轻量级交付形态比完整 SaaS 更容易被大型机构接受。如果你在做 To B AI 产品评估 Skills/智能体市场上架这条路它的销售周期远短于传统采购但也要接受平台抽成与规则约束。如果你在金融机构多平台并行接入会带来能力分散与合规口径不一致的问题建议提前定好「同一答案在不同平台必须一致」的校验机制。现在可以做什么✅ 盘点自家可对外输出的专业能力挑 2-3 个做成标准 Skill/智能体先在一家平台上架试水✅ 建立跨平台回答一致性测试集避免同一问题在不同生态给出不同结论金融场景这是合规风险 来源中国基金报网易转载 · 证券时报网/新浪财经️ #智能体落地 #金融AI #券商 #Skills生态 #国内动态 B 级 · 补充阅读9. a16z 第七版榜单近一半美国人用过 AI只有 4.5% 在掏钱 速览头部 1% 付费用户月均 903 美元、贡献 19.5% 消费29 家支出前 50 不在任何流量榜。发生了什么a16z 发布第七版《Top 100 消费级 AI 应用》及《市场状况 II》报告。本期首次引入 YipitData 基于美国消费者银行卡/信用卡面板的支出维度与 Similarweb 网页访问、Sensor Tower 移动月活并列。核心数据近一半美国消费者称在使用 AI但只有25% 达到日常使用频率截至今年 8 月仅4.5%的美国消费者持有 ChatGPT、Gemini 或 Claude 中至少一个活跃个人付费订阅付费呈极端幂律——前 1% 付费用户贡献 19.5% 的可观察消费高于底部 50% 用户合计的 16.6%这批重度用户月均花费903 美元主要买编程、效率与创作工具前 10% 付费者约占全部消费的一半。同时进入网页、移动、支出三张榜的公司只有 7 家ChatGPT、Claude、Suno、Perplexity、Photoroom、Canva、Notion而有 29 家支出排名前 50 的厂商根本不在任何流量榜上。本期新增首次上榜产品仅 11 个为七期以来最少。a16z 分析师 Olivia Moore 总结「消费者 AI 使用很广但对几乎所有人来说都不深。」对你意味着什么「流量 ≠ 收入」这件事第一次被量化到了这么清晰。29 家不出流量榜的高支出厂商说明存在一整类不需要大众流量也能活得好、且活得很好的 AI 生意。这对小团队是好消息——你不必冲榜只要牢牢抓住那群愿意每月花几百美元的人。反面是如果你的产品靠订阅制覆盖模型成本天花板可能比你想象的更早到来。如果你在做消费级 AI 产品重新审视定价模型。订阅制早期能覆盖成本但 a16z 明确指出它在压低普及天花板个人智能体、广告、交易抽佣等新模式正在浮出。如果你在做 B 端那 29 家「隐形高收入」厂商值得逐个研究它们大概率是工具型、垂直型、被少数人重度依赖的产品。现在可以做什么✅ 算一下你产品里前 1% 用户贡献了多少收入如果结构类似考虑为他们设计独立的重度档位而非拉新✅ 别把「月活」当北极星指标改用「高频付费用户的周留存」 来源华尔街见闻网易转载 · 卡兹克解读 · Moneycontrol 汇总️ #a16z #消费级AI #付费转化 #商业模式 #用户留存10. Anthropic 5180 亿算力承诺里4137 亿是不管用不用都得付的 速览五年算力支出中约八成为不可撤销承诺平均每年约 410 亿美元。发生了什么据 10 月 6 日流传的测算Anthropic 计划未来数年在云计算与算力上支出5180 亿美元其中约4137 亿美元为不可撤销承诺——即使容量闲置也必须支付平均每年约 410 亿美元。这一数字与其招股书披露的信息方向一致Anthropic 2025 年收入接近 46 亿美元经营亏损超过 80 亿美元总义务规模达 5180 亿美元并在招股书中自陈「存在性风险」。此前另有报道称博通最多借给 Anthropic 420 亿美元用于租用自己的 TPU约占五年 1252 亿租金的三分之一Anthropic 自己在招股书里把它标注为「潜在利益冲突」。对你意味着什么这条不该只当财经新闻看。当供应商的收入里有八成是「不管客户用不用都收」的刚性承诺它的定价行为会变得很激进——它必须让客户把额度用掉于是会出现更多「套餐捆绑、额度赠送、限时折扣」。这解释了 SemiAnalysis 近期测算的「Anthropic 订阅的 API 等价价值约为 OpenAI 的 5 倍以上」也解释了为什么 Anthropic 近期在折扣政策上反复调整。对采购方来说这是可以谈价的窗口期。如果你在批量采购模型服务供应商的刚性成本压力是可以利用的谈判筹码年度承诺换折扣的空间今年比往年大。如果你在评估供应商稳定性高刚性承诺 高经营亏损的组合意味着它对续约率极度敏感长期合同要写清价格保护条款。现在可以做什么✅ 核对你的年度承诺额度使用率用不完的部分主动去谈展期或折扣别让它过期✅ 在长期合同里加入价格重议条款与退出条款规避供应商被动调整套餐的风险 来源Rohan Paul 转述测算 · SemiAnalysis订阅价值对比️ #Anthropic #算力成本 #采购谈判 #AI基础设施 #财务风险11. Claude 全家搬上云Code 云端会话、Cowork 迁云、Workspace 打通 速览每个任务独占一台 VM、合盖不中断Cowork 的 VM 也从本地移到云端。发生了什么Anthropic 近日密集把运行环境往云端搬。Claude Code 推出云端会话每个任务跑在独立 VM 上、仓库克隆到新分支可从 claude.ai/code、手机、桌面端、终端和 Slack 启动并跟踪完成后产出可直接转 PR 的分支Pro/Max/Team/Enterprise 计划不额外收费。同时 Claude Code v2.1.292 发布新增claude plugin install --marketplace在同一策略校验下自动添加市场并安装插件与 Agent 的effort参数可指定子智能体的努力度等级并修复了沙箱命令读取暂存文件、UNC 路径绕过文件读取权限提示等多项安全与稳定性问题。Cowork 架构也改了Anthropic 工程师 Felix Rieseberg 说明旧版是云端推理 用户电脑上运行本地 VM磁盘、电池和性能开销大合上笔记本工作就停新版把模型推理和 VM 都移到云端每会话独立沙箱桌面应用只负责文件访问等需要本机设备的工具调用。此外Claude for Google Workspace 开启 beta一次安装即可在 Google Docs、Sheets、Slides 中直接编辑。对你意味着什么三家OpenAI Codex、Anthropic Claude Code、Cowork在同一周把「本地运行」改成「云端常驻」这不是巧合——智能体的工作时长正在超过人的在线时长本地设备成了瓶颈。对你的直接影响是任务可以真正在后台跑完但同时也意味着你的代码和数据要放进别人的 VM。用之前想清楚边界。如果你在做长周期任务大规模重构、批量迁移、长时间研究云端会话能解决「合盖就断」的老问题值得切换。如果你有数据合规要求云端 VM 意味着代码会短暂驻留在供应商环境敏感仓库先确认是否有私有云/自托管选项IBM Bob 等已提供自托管路线。现在可以做什么✅ 用effort参数给不同子任务分级配算力简单任务调低一档能省不少✅ 给云端会话设仓库白名单禁止把含凭据或客户数据的仓库交给云端 VM 来源Claude Code 云端会话 · Simon WillisonCowork 架构变更 · Claude for Google Workspace · v2.1.292 Release️ #ClaudeCode #Cowork #云端智能体 #工程效能 #Claude12. Nano Banana 2.1 上线图像价格砍半旧版 10 月 29 日停服 速览1K 图从 6.70 美分降到 3.36 美分支持最多 14 张参考图与 4K 全景。发生了什么Google 于 10 月 6 日发布图像生成与对话式编辑模型Nano Banana 2.1gemini-nano-banana-2.1接替 2026 年 2 月发布的 Nano Banana 2gemini-3.1-flash-image。官方更新日志显示gemini-3.1-flash-image 将于 2026 年 10 月 29 日停用。价格约降一半1K 图像从 6.70 美分降至3.36 美分4K 从 15.10 美分降至7.56 美分。能力上支持最多 14 张参考图与 4K 全景输出已同步上线 fal、OpenRouter 与 Arena 的三个图像榜单多图编辑榜暂列第 4。对你意味着什么图像生成的价格今年已经跌到「按分计」的量级竞争焦点从「能不能生成」转到「能不能稳定编辑」。对做电商素材、内容批量生产的团队价格腰斩意味着可以放开跑 A/B 和多版本但 10 月 29 日的停服日期是个硬截止还在用旧版 ID 的业务要尽快迁。如果你在批量生成商品图/素材成本降到一半可以把「多版本生成 人工挑选」从奢侈品变成常规流程。如果你用 API 在跑生产10 月 29 日前必须完成模型 ID 迁移这类硬停服通常不给缓冲。现在可以做什么✅ 立刻检索代码里所有gemini-3.1-flash-image的调用点排期在 10/29 前切到 2.1✅ 用 14 张参考图的能力重做一遍你的「保持角色/商品一致性」流程多参考图是当前成本收益比最高的玩法 来源Gemini API 更新日志 · The Decoder️ #NanoBanana #图像生成 #Gemini #API迁移 #成本下降✍️ 编辑点评今天读下来最强烈的感觉是智能体正在从「能不能做到」进入「允不允许做」的阶段。网站在问它是谁法院在问它说的话算不算数METR 在问我们还能不能相信日志。这些都不是坏消息——一个东西开始被追问身份说明它真的进了场。倒是我们自己得跟上别再把「跑通了」当成「可以上线了」。明天开始多问一句「如果它骗我我怎么知道」。