2026-07-29 AI 新闻汇总

发布时间:2026/7/30 4:29:10
2026-07-29 AI 新闻汇总 1. 贾扬清离开英伟达创办 Intent LabFleet 系统一句话驱动 GLM-5.2 推理提速6.3 × 6.3 \times6.3×瞄准软件工程团队外包给 Agent7 月 29 日Caffe 作者、前阿里巴巴技术副总裁贾扬清在 X 平台宣布创办 AI 软件公司 Intent Lab并已将英伟达列入过往任职经历——这意味着其创立的 Lepton AI2025 年 4 月被英伟达以约 7 亿美元收购更名为 DGX Cloud Lepton的整合仅维持了一年便告结束。联合创始人包括白俊杰ONNX 联合创始人、李响etcd 创始人与 Casber Wang团队定位明确指向AI 系统基础设施。Intent Lab 的核心产品是一套名为 Fleet 的自主 AI 团队系统。与 Cursor、Claude Code 等主要辅助人类编写和修改代码的工具不同Fleet 试图从用户的一句模糊需求出发自主完成软件架构设计、代码实现、测试验证、上线运行并在投入生产后持续维护和更新。贾扬清的表述是模型现在写代码已经很快了但从’能跑的代码’到’能放心投入生产并维护多年的软件’中间仍有距离。我们想补上这一层。“他同时把 Intent Lab 的目标概括为一次能产出一千个系统的系统”。Fleet 公布的首批三个案例均宣称由系统端到端完成无人工介入推理引擎优化仅凭一句改造 TensorRT-LLM 让 GLM-5.2 跑在 Grace Blackwell 节点上的指令Fleet 自主完成四类优化——由智能体直接生成 PTX 和 SASS 指令绕过编译器的内核优化、将单步 host-to-device 拷贝从约十次降至零的运行时优化、融合 residual add 与 RMSNorm 的通信优化以及配合 DSpark drafter 的投机解码加速。两台节点上的输出速度从102 102102tokens/s 提升至647 647647tokens/s提升6.3 × 6.3 \times6.3×。投资人 Mike Vernal前 Facebook 高管在讨论中补充称该系统自主优化后实现超过5 × 5 \times5×的速度提升两个数字的差异可能源于度量口径不同。数据库引擎构建仅凭一行 promptFleet 从零构建了一个数据库引擎自主完成架构、编码、测试、评审全流程最终通过约600 600600万条 SQLite 兼容性测试。科技投资人 Kevin Xu 特别指出SQLite 体量虽不及大型分布式数据库但对一致性和可靠性的要求极高单句指令直接完成生产级改造并不简单。形式化验证文件系统构建了一个带形式化验证的文件系统并在开发过程中自主抓取并修复了瞬态数据损坏漏洞。Intent Lab 强调上述三个案例并非由分别定制的三个工具完成而是来自同一套通用系统。该公司将 Fleet 定位为autonomous fleet——不是再做一个更会写代码的 agent而是把编码 agent 没覆盖的那段路接管掉从一句模糊的 Intent 开始到生产级软件落地之间包括澄清目标、做设计、拆任务、协同依赖、实现、验证和上线后的持续演化。利益关联披露上述性能数据6.3 × 6.3 \times6.3×提速、600 600600万条测试通过、形式化验证完成均来自贾扬清本人及 Intent Lab 投资人 Mike Vernal 在 X 平台的公开发布目前尚无独立第三方对结果进行复现验证。贾扬清与联合创始人的技术背景Caffe、ONNX、etcd、Lepton AI为系统能力提供了可信背书但 Fleet 是否能在非演示场景下保持同等表现仍待观察。该创业方向的产业含义清晰当 coding agent 已能快速生成代码下一个竞争维度正从代码生成质量转向软件工程全生命周期自主交付——谁能把意图闭环到可维护的生产级系统谁就占据 agent 价值链的更高位置。来源机器之心 / 网易 | 云头条 / 网易 | 猎云精选 / 腾讯新闻 | 微博技术解读 | 凤凰网 | 2026-07-292. OpenAI 开源 Codex Security CLI扫描 120 万次提交发现 792 个严重漏洞真阳性率74 % 74\%74%显著高于 Snyk 与 Semgrep7 月 28 日至 29 日OpenAI 在 GitHub 上以 Apache-2.0 许可证开源 Codex Security 的 CLI 工具与 TypeScript SDKnpm 包名openai/codex-security仓库 openai/codex-security。该项目前身为 3 月以研究预览形式发布的Aardvark此次开源的是客户端工具链扫描所依赖的模型推理仍为 OpenAI 托管的云端服务当前研究预览阶段面向 ChatGPT Enterprise、Business 与 Education 用户。Codex Security 的工作流程分为三阶段与传统静态扫描工具SAST的规则匹配路径不同第一阶段读取代码库并对可能的漏洞进行排序与文件审查第二阶段在沙箱中验证候选项构建实际攻击路径以剔除误报第三阶段对确认的漏洞生成修复补丁。扫描进度按阶段上报结果可导出为 SARIF、CSV 或 JSON 格式SARIF 输出可直接对接 GitHub Code Scanning。OpenAI 披露的公开测试阶段数据显示Codex Security 累计扫描超过120 120120万次提交在 OpenSSH、GnuTLS、PHP、Chromium 等开源项目中发现792 792792个严重漏洞和10561 1056110561个高危漏洞。在一份第三方对比测试中基于16.2 16.216.2万行生产代码Codex Security 的真阳性率为74 % 74\%74%Snyk 为28 % 28\%28%Semgrep 为20 % 20\%20%。该对比测试的具体方法论与代码样本未在开源仓库中完整披露数字本身为 OpenAI 自报。工具的工程化设计有几个细节值得注意预提交钩子install-hook命令可在每次 git commit 前自动扫描改动过的代码发现高危问题直接拦住提交且尊重已有的core.hooksPath配置不会覆盖现有钩子。CI 集成的退出码设计默认扫描为 report-only 模式传入--fail-on-severity high后达到阈值及以上的发现才会使退出码为1 11。值得注意的是扫描未完成或失败时退出码为2 22确保错误不会被伪装成通过。成本控制默认使用 gpt-5.6-sol 模型在 extra-high reasoning effort 下扫描可通过--model gpt-5.6-terra切换每次扫描记录模型、token 消耗与估算成本--max-cost 5可限制单次扫描预算。批量扫描提供bulk-scan命令从 CSV 仓库列表并行扫描支持--workers控制并发配合 Docker 镜像可实现非交互式、可断点续跑的大规模扫描。部署限制方面扫描结果目录必须位于仓库之外macOS/Linux 上 chmod 700因为结果包含源码摘录、漏洞详情与复现步骤。工具自身的漏洞需提交至 OpenAI 的 Bugcrowd 项目而非 GitHub Issues。当前版本为 v0.1.1ESM-only在 1.0 之前公开 API 可能随小版本变更。该开源动作的市场背景是 AI 编程工具生成的代码量快速膨胀后安全审查瓶颈随之显化——人工 review 慢且覆盖不全传统 SAST 误报率高。OpenAI 的路径是用 AI 读代码、找漏洞、写补丁将安全审查嵌入 CI 流水线。与阿里 open-code-review确定性工程× \times×Agent 混合和微软 MAI-Cyber-1-Flash专用小模型 通用大模型分工相比Codex Security 的差异化在于与 OpenAI 自家 Codex 编程生态的深度集成以及 find-validate-patch 三阶段闭环对误报的过滤机制。来源GitHub: openai/codex-security | 安全客技术解读 | oflight.co.jp 实操指南 | 微博测试数据 | 2026-07-28 ~ 07-293. 微软发布 Mage-VL让视频编码器决定模型看哪些像素视觉 token 削减超75 % 75\%75%推理提速最高3.5 × 3.5 \times3.5×7 月 27 日微软 Mage 团队在 arXiv 发布论文《Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model》arXiv:2607.24904并同步开放 HuggingFace 模型与 GitHub 仓库。这是一款4 44B 参数的编码原生codec-native流式多模态基础模型视觉编码器完全从零训练针对现有视觉语言模型VLM在流式感知场景下的效率短板。论文提出的核心问题是 VLM 的莫拉维克悖论现有模型在复杂离线视觉推理上表现出色但在简单实时流式感知任务上却既慢又耗算力。根因在于主流 VLM 采用均匀帧采样——把视频解码为像素后等间隔取帧每帧切成 patch token 送入视觉编码器。一分钟视频里大部分帧的内容与前一帧几乎相同静止背景均匀采样会产生大量描述没动过的墙的冗余 token而注意力机制的计算成本随序列长度急剧上升。Mage-VL 的解法是借用视频编解码器数十年前就解决好的问题每个视频编码器本质上就是一台判断信息在哪里的机器。它存储少量完整的锚帧I 帧中间帧只存储变化部分——运动向量描述像素块如何移动残差描述运动无法解释的部分。当编码器给某个区域分配大量比特时意味着那里确实发生了变化分配很少比特时意味着那里是重复。这种比特分配本身就是一张免费的显著性图而现有视频模型都在解码成像素后把它丢弃了。Mage-VL 读取这张图锚帧的所有 patch 全部保留预测帧只保留编码器花了比特的 patch。同一接口兼容传统编码器H.264/AVC、HEVC/H.265通过运动向量 残差能量和神经编码器DCVC-RT通过学习到的码率图无需架构或重训练改动。保留下来的 token 用共享的16 × 16 16 \times 1616×16patch 网格与 3D 旋转位置编码标记送入 Qwen3-4B-Instruct-2507 因果解码器项目中唯一的预训练组件。训练规模方面Mage-ViT 从零训练使用约5.6 5.65.6亿张无标注图像和1 11亿帧无标注视频匹配或超过在数十亿图文对上训练的旗舰编码器。原生分辨率预训练让 Mage-ViT 随 token 预算单调提升676 676676token 时 Food-101 超过96.1 % 96.1\%96.1%、ImageNet 超过86.3 % 86.3\%86.3%而固定分辨率编码器会饱和或退化。性能数据视觉 token 消耗减少超过75 % 75\%75%约降至密集帧采样的1 8 \frac{1}{8}81​或更少在准确率持平的前提下推理速度提升最高3.5 × 3.5 \times3.5×单 8× \times×B200 节点多数视频基准上为所有对比模型中最快。在 Qwen3-4B 骨干固定的条件下仅替换 ViTMage-VL 在所有报告的视频与时序定位基准上均优于 Qwen3-VL-4B定位密集任务提升最大QVHighlight 22.5 22.522.5、ActivityNet 17.1 17.117.1、VSI-Bench 11.0 11.011.0、VideoEval-Pro 24.5 24.524.5。静态图像任务上与 Qwen3-VL-4B 持平空间智能任务明显领先VSI-Bench 11.0 11.011.0、CrossPoint 53.1 53.153.1、EmbSpatial 5.2 5.25.2。4 44B 参数的 Mage-VL 在多项基准上全面超过15 1515B 的 Phi-4-reasoning-vision。架构上还采用生物启发的双系统设计轻量级的 System 1 认知门监视每个滚动的编码窗口对常规内容保持沉默仅当值得响应的事件完成时才调用完整的 System 2 VLM——无需多智能体流水线即可在单一模型内实现主动流式感知。一个结构性局限需要部署时关注编码器把比特分配给变化区域这是什么重要的良好代理但不等同于什么重要。静止区域可能语义关键——固定字幕、不动仪表读数、屏幕上的价格、稳定持握的文档——这些区域恰恰因为稳定而获得很少比特信任比特分配作为显著性度量的系统会在它们身上花最少的 token。用于监控、文档或仪表盘视频的场景应专门测试这一情况。所有性能数字均为微软自评部分在仓库描述的 8× \times×B200 环境上运行尚无独立团队复现。该工作的可移植性是其最有价值之处不需要新架构、新训练目标或新硬件只需要认识到压缩视频本身已附带显著性信号丢弃它再从头重建是一种选择而非必然。来源arXiv:2607.24904 | HuggingFace: microsoft/Mage-VL | 微软项目主页 | dev.to 技术解读 | 2026-07-27 ~ 07-294. OpenRouter 周榜全球大模型调用量前五全部为中国模型中国模型全球份额升至约2 3 \frac{2}{3}32​7 月 27 日多模型聚合平台 OpenRouter 发布最新数据截至 7 月 26 日的 28 天窗口内中国模型全球调用份额约为63.5 % 63.5\%63.5%美国模型为35.5 % 35.5\%35.5%——中国模型占据全球约2 3 \frac{2}{3}32​的市场份额。在 7 月 20 日至 26 日的周榜上调用量前五全部被中国企业自研大模型占据小米 MiMo-V2.510.5 10.510.5万亿 tokens环比 12 % 12\%12%、DeepSeek V4 Flash6.37 6.376.37万亿 18 % 18\%18%、腾讯混元 Hy33.94 3.943.94万亿环比增幅超999 % 999\%999%、智谱 GLM-5.23.29 3.293.29万亿− 10 % -10\%−10%、DeepSeek V4 Pro3.17 3.173.17万亿 17 % 17\%17%。小米 MiMo-V2.5 同时登顶周榜与月榜月调用量31.20 31.2031.20万亿 tokens超过 DeepSeek V4 Flash 的23.58 23.5823.58万亿。各模型的定位与增长逻辑差异明显小米 MiMo-V2.54 月 23 日公测4 月底全系列开源。MoE 架构总参数突破万亿级别激活参数42 4242B标配100 100100万 token 上下文覆盖文本、语音、图像、视频全模态。5 月以来单周 token 量从1.46 1.461.46万亿升至10.46 10.4610.46万亿两个月增长约616 % 616\%616%。低推理成本与稳定的智能体运行能力是其吸引海外开发者批量接入的核心优势。DeepSeek 双型号高低搭配V4 Flash总参284 284284B、激活13 1313B主打低成本快速推理V4 Pro总参1.6 1.61.6T、激活49 4949B对标海外顶级闭源模型的代码与复杂智能体任务MIT 完全开源。两款同步于 4 月 24 日发布。腾讯混元 Hy37 月 6 日开源总参295 295295B、激活21 2121B快慢思考融合架构最大256 256256K 上下文。开源三周即实现海外调用量爆发式增长是本周增长最猛的模型。智谱 GLM-5.26 月 15 日全量开源753 753753B 参数基座主打长周期工程任务代码与数据分析专项评测居开源模型第一梯队。本周环比下滑10 % 10\%10%。OpenRouter 平台的特殊性在于它聚合的是全球数万海外独立开发者与海外中小型 AI 应用的真实付费调用请求所有 token 用量统一计量标准可客观反映全球开发者在市场化渠道的真实选择。这意味着国产开源模型正在打破海外厂商生态壁垒在完全市场化的第三方渠道实现领先。该数据由央广网、界面新闻、南方都市报、每日经济新闻等多家媒体独立报道并交叉印证。但榜单的局限性同样需要诚实看待国内互联网大厂自有 App 流量、企业私有化部署流量、美国大厂封闭 API 流量均不在统计范围内无法完整代表全球 AI 调用总量仅作为海外开源赛道的观测窗口。在综合性能维度Chatbot Arena 竞技场 7 月最新榜单中 DeepSeek V4、GLM-5.2 跻身开源模型前五但综合性能天花板仍由 Claude、GPT 系列闭源模型把持。Artificial Analysis 综合技术评测榜单上国产多款开源模型持续刷新开源赛道最高分与海外闭源前沿仍存在小幅代差。流量领先与技术全面领跑是两个不同维度的竞争。前者反映性价比与开发者生态选择后者反映硬核推理能力上限。英伟达 CEO 黄仁勋近日谈及中美 AI 技术时称杰出的人才总会找到出色的答案中国注定会产出卓越的 AI 技术并表示市场一开始误解了 DeepSeek 带来的影响又再次误解了 Kimi。马斯克在《经济学人》访谈中表示未来某个时刻中国极有可能成为 AI 领导者美国就算禁用中国模型也挡不住。这两位行业核心人物的表态与 OpenRouter 的调用数据指向同一趋势国产开源模型在市场化落地流量上已实现反超但从流量领先到技术全面领跑的跨越仍需在算力自主、底层生态、前沿创新多维度持续攻坚。来源央广网 | 界面新闻 | 南方都市报 | 每日经济新闻 / 腾讯新闻 | 2026-07-27 ~ 07-285. OpenAI 发布科研软件现代化田野报告8 个项目中 3 个跨厂商使用 Codex 与 Claude Code加速而非替代7 月 28 日OpenAI 发布一份田野报告field report覆盖 8 个真实科研项目记录团队使用 Codex——其中 3 个项目同时使用 Codex 与 Claude Code——对生命科学与基因组学领域的科研软件进行现代化的实际结果。这不是实验室演示而是研究人员日常依赖的生产代码库。8 个项目覆盖四类工作遗留软件现代化将旧 Fortran、C 或早期 Python 代码转换为现代可维护的等价物、GPU 原生重设计将 CPU 绑定的科研算法重写为 GPU 运行以获得显著加速、大规模语言迁移将整个研究代码库迁移到新编程语言或框架、定向优化识别并修复拖延多年的性能瓶颈。5 个项目单独使用 Codex3 个项目同时使用 Codex 与 Claude Code——这一跨厂商组合值得注意它在实践中验证了多 agent 工作流的有效性。报告的核心发现是加速而非替代。多个案例中agent 承接了原本需要数月专业工程时间的工作并压缩到数天。小型研究团队——通常是几位软件工程带宽有限的科学家——得以启动此前无法证明合理性的现代化项目。但报告对这一加速的边界保持坦诚人工验证全程必不可少。Agent 能快速写代码但科研软件的正确性要求超越能否编译——输出需要与既有研究结果匹配、处理实验数据中的边缘情况、保持可复现性。每个重要的 agent 生成变更都需要人工审查与测试。长期所有权问题是隐忧。当 agent 对代码库做出大规模变更后谁对新代码足够了解以维护它如果答案是没有人那么只是用一种技术债换了另一种。表现最好的团队把 agent 生成的代码视为理解的起点而非部署后即可遗忘的最终产品。跨厂商组合的合理性。3 个项目同时使用 Codex 与 Claude Code 并不意外——不同模型在不同任务类型上各有优势研究团队在实践中用脚投票选择组合而非拘泥于单一供应商。这与 OpenAI 此前发布的 Codex 负责人访谈中协作型人格与多智能体网络的方向一致。OpenAI 同时在开发者文档中发布了配套指南《Building an AI-Native Engineering Team》将 SDLC软件开发生命周期各阶段——计划、开发、审查、部署——中 coding agent 的介入方式与人类工程师的角色边界做了系统梳理。指南的核心主张是agent 承担执行工作可行性分析、架构分析、代码实现、测试、文档、依赖维护、feature flag 清理而科研责任与战略决策优先级、长期方向、排序、权衡仍由人类负责。该报告的行业含义在于提供了一份去营销化的实证样本没有基准分数没有震撼发布只有 8 个真实项目里 agent 做了什么、没做什么、人在哪里介入。对正在评估 coding agent 落地的研究机构与企业工程团队这份报告比任何 leaderboard 都更有参考价值——它回答的不是模型多强而是在真实科研代码库上agent 现在能交付到什么程度。利益关联披露该报告由 OpenAI 自身发布8 个项目中有 5 个使用 OpenAI 自家 Codex 产品报告对 Codex 能力的描述存在利益关联。3 个跨厂商项目使用 Claude Code 的事实由 OpenAI 自报未获 Anthropic 独立确认。报告未披露 8 个项目的具体代码库与可复现的量化指标读者应将其视为方向性参考而非可复现的基准。来源subagentic.ai 田野报告解读 | OpenAI 开发者指南 | 2026-07-28