
多模态与实时交互语音 Agent 与 Computer Use 的架构分析前几章构建的 Agent 与世界的交互是轮流的用户说完一句Agent 想一段、调用几个工具再回一句在它思考的这段时间里世界被默认为静止的。这个前提如此自然以至于很少被当成一个假设写出来。然而真实环境不会等模型作出反应邮件在思考时到达用户在说话途中插话页面在两次截图之间已经变了样。本文围绕模态和触发时机两个维度对 Agent 交互架构的扩展进行技术分析涵盖异步事件驱动、语音交互范式、Computer Use 以及机器人操作。两个扩展维度把观察空间和动作空间摊开会发现它们各有两个可以扩展的方向模态决定观察和动作的形式Agent 是只读文本还是也能听见声音、看见屏幕、感知力矩是只能输出 token还是也能发声、点击、驱动关节。触发时机决定观察和动作的节奏观察是 Agent 主动去取还是世界主动推来动作是必须在一个回合内做完还是可以跨越回合、中途被打断、被更紧急的事抢占。尺度场景观察侧的变化动作侧的变化秒-天异步与事件驱动会被外部事件主动唤醒的 Agent动作跨回合先发起后续靠事件收尾10 毫秒-1 秒语音边说边听不等一句说完边想边说可被打断亚秒-秒Computer Use屏幕在两帧之间持续变化动作后必须重新确认现实是否仍符合计划毫秒机器人传感器连续回流动作分块一次规划一小段可被抢占异步与事件驱动当世界主动找上门核心矛盾训练同步部署异步LLM 的训练范式假设同步——发出工具调用后下一条消息必须是工具结果。而真实部署要求异步——用户随时可能打断多个任务可能并发推进外部事件可能在工具尚未返回时就抵达。这一训练同步/部署异步的矛盾贯穿了异步 Agent 架构的所有工程取舍。事件驱动的异步 Agent 架构不再主动反复检查有没有新消息轮询效率低而是在新消息到达时自动触发处理逻辑。所有的输入、输出、思考过程和外部交互都被统一建模为事件流。基于紧急度的三种处理策略一个 Agent 实例可能同时面对多个事件用户的新消息、工具返回的结果、定时器到期、另一个 Agent 的协作请求。三种处理策略的区别在于对待安全点的方式取消式处理用于紧急事件主动中断当前步骤把这一刻变成可以消费新事件的边界。系统停止当前操作清空待处理队列将所有事件一次性追加到轨迹末尾立即重新调用 LLM。这对应于用户在 Agent 执行可能错误的操作时输入停我说错了的场景。队列式处理用于常规事件不打断当前操作等待当前操作完成后将所有事件一次性追加。例如 Agent 调用搜索工具后用户补充只看最近一个月的结果搜索结果返回时两个事件一起呈现给 LLM避免不必要的往返。并行处理用于独立的轻量级查询如今天天气怎么样。既不打断主任务也不让用户等太久在并行推理会话中独立执行。工程权宜模拟同步的异步实现核心思想是在没有打断发生的常态下让 LLM 看到标准的同步轨迹只在打断时才插入占位符来修复格式。有五条关键规则LLM 输出后立即记录 assistant message工具调用完成时才记录 tool result工具执行中的打断需要占位符LLM 思考中的打断直接丢弃当前思考非打断事件进入队列等待批处理。这套方案的核心优势是常态下 LLM 看到的是完美的同步轨迹最大程度保证了思考质量。但仍存在加剧幻觉的风险尽管占位符明确说明工具尚未完成系统仍可能在后续思考中编造一个工具结果基于虚构的结果做出不恰当的决策。语音从级联到全双工的范式演进语音的价值不只是把文字换成声音。正常说话的速度约为打字的四倍而且不占用双手与视线因此它天然适合把 Agent 放进持续工作、随时可能被打断的输入输出回路。三种交互范式的主线是如何摆脱轮流说话和 VAD语音活动检测对发言权的猜测。范式核心结构主要优势主要限制级联VAD - ASR - LLM - TTS模块清晰、易替换、易调试延迟累积副语言信息在接口处丢失端到端 Omni原生音频输入输出按轮次交互延迟较低能保留语气、情绪和环境声仍依赖轮次训练和调试成本较高全双工原生音频输入输出持续听、说和决策支持重叠说话、自然打断和连续流模型训练、控制和评估都更复杂级联流水线及其优化绝大多数商业语音助手基于串行流水线VAD 判断用户何时说完ASR 把音频转成文字LLM 理解并生成回复TTS 再把文字念出来。模块化让每个组件可以独立优化但每一级都可能增加等待时间。级联方案有三个问题延迟累积必须等待一段静音才能确认说完、信息丢失有声/无声二值信号无法表达犹豫、情绪和环境声、上下文被切断专有名词可能被分片识别而出错。流式感知是一种保留模块化分工前提下的优化方案ASR 边听边转LLM 推测执行TTS 增量合成让各阶段尽早产出增量结果。全双工交互模型Omni 仍然把对话分成用户说和模型说两个时段但同声传译等任务要求两者重叠进行。全双工模型不再预设轮次而是持续听、持续说并不断决定继续、停顿、打断或调用工具。Thinking Machines Lab 将这类路线称为交互模型交互性不再依靠 VAD 等外部 harness 拼装实现而是内建在模型中。OpenAI 的 GPT-Live 则把全双工路线带到生产规模。快慢思考分离与端到端统一的取舍交互表现和智能上限是两个维度前台模型要在用户仍然在线时回应后台模型可以花更多时间思考。三种方案是设计取舍快思考回应慢思考回答、快思考交互慢思考提醒、端到端思考与表达统一。快慢分离有一个重要的工程优势它能直接承接慢模型的迭代红利。前台快模型只负责低延迟地倾听、应答和维持对话后台慢模型负责推理、规划和工具调用更强的思考模型发布后只需替换后台模型不必重新训练整套实时语音系统。统一路线则把推理与交互绑定在同一个训练周期中每次升级都要重新兼顾智能水平、响应延迟和表达自然度。Computer UseGUI 自动化 Agent语音把时机轴推到了毫秒级但它的观察仍是一维的声音流。Computer Use 把同一个问题搬上二维的屏幕观察变成持续变化的像素动作变成坐标上的点击与输入。感知-思考-行动循环Computer Use 的核心是一个感知-思考-行动循环Agent 截取当前屏幕画面多模态模型接收截图和任务指令输出一个具体动作执行层在真实环境中执行该动作等待界面响应后再次截图进入下一轮循环。这里要区分看懂界面和完成任务。前者更接近多模态理解能力可以用一次截图问答来测量后者则要求模型把理解和生成动作放进闭环处理页面加载、状态变化、误操作和不可逆后果。Computer Use 的难点不只是让模型在截图上答对而是让它在每一步之后重新确认现实是否仍符合计划。动作空间设计Anthropic 的参考实现把完整交互能力分成三类工具GUI 操作工具鼠标移动/点击/拖拽、键盘输入、截图等、命令执行工具持久 bash 终端会话、文件编辑工具基于字符串匹配的安全编辑。这是一个清晰的动作空间设计但不是必须遵守的私有协议只要 Harness 能把同样的截图、动作约束和执行结果转换成目标模型支持的消息与结构化输出不同模型都可以驱动同一个循环。视觉定位的三条路线在循环的每一轮中模型需要在截图中准确定位目标元素。当前主要有两条思路把定位变成选择题先把界面元素标注好编号模型只需从中选一个。有两种实现方式——纯视觉标注Set-of-Mark用分割模型在像素上切出候选区域和结构化元素索引DOM/Accessibility Tree直接读取界面自带的结构。后者的优势是把开放式的在截图中找到按钮并预测坐标转化为封闭式的从已标注好的元素中选一个就像考试中选择题比填空题更容易答对。纯坐标预测不做任何标注直接让模型输出坐标。以 SeeClick 和 Claude 的 computer use 为代表在海量 GUI 截图和元素位置的配对数据上训练视觉模型让它学会将自然语言描述直接映射到截图中的精确坐标。模型对坐标的理解高度依赖训练时使用的分辨率因此需要在工具层实现双向坐标缩放机制。三条路线的选择逻辑结构化信息可得时优先用 DOM/Accessibility Tree 索引定位最精确稳定不可得时原生桌面软件、Canvas/WebGL 渲染的界面、游戏可以用视觉标注或坐标预测。Computer Use 的世界模型传统 Computer Use 假设屏幕是静止的——截一张图、想一步、点一下再截下一张图。可现实里的屏幕会放视频、会弹出转瞬即逝的通知、会播放会议里的人声。观察接口AOI通过屏幕关键帧截图、音量门控的语音转写和文字描述画面等技术把连续的环境观察转换成模型便于处理的离散事件。更进一步世界模型让 Agent 能够在行动前预测桌面接下来可能变成什么从而实现类似于人类的推测执行机制如果实际变化与预期一致就沿着原定计划继续执行只有发现页面状态偏离预期才停下来重新观察和规划。2026 年 Induction Labs 公布的 Photon-1 展示了这条路线的一种实现把每帧压缩为离散的潜在 token自回归预测动作之后的下一状态表示。移动端的生态壁垒Computer Use 在移动端面临的主要挑战往往不是技术差异而是生态壁垒。传统互联网应用的核心变现逻辑是流量与注意力用户刷信息流时看到广告浏览页面时产生冲动消费。当 Agent 代替用户操作时这条变现链路被彻底绕过AI 不会关注广告也不会冲动消费直奔目标完成任务就走。这意味着 Computer Use 面对的不仅是 CAPTCHA 等技术对抗更是一个结构性的利益冲突。机器人操作从仿真到真机机器人操作比看图回答问题难得多。模型不但要看懂画面还要在真实世界里连续做出动作而且每个动作都会改变下一刻的情况。机器人系统通常把不同时间尺度的工作分开任务目标分钟级、长程规划秒到分钟、基本技能约 1-3 秒、VLA/技能策略约 1-10 Hz 推理、底层控制与安全层约 50-1000 Hz。这种分工的关键是把任务顺序和眼前动作分开否则高层模型的推理延迟会拖慢底层控制。VLAVision-Language-Action模型接收当前画面和技能指令输出机器人接下来要执行的动作。但 VLA 有几个局限训练数据有限机器人演示远少于互联网文本和图像数据、只学会模仿不一定懂后果、机器人各不相同、观察可能过时。因此需要世界模型帮助判断做了之后可能发生什么。从仿真环境到真实机器人并不是再换一种控制器而是要处理两个环境之间的差异训练时使用遥操作数据、视频数据或仿真交互数据部署时同一个物体出现在不同的背景、光照、相机位置和遮挡关系中机械臂还会遇到不同的摩擦、传感器噪声和执行器延迟。小结顺着模态和执行时机两根轴看异步与事件驱动把观察从Agent 主动去取扩展为世界主动推来模态没变变的只有时机。语音把尺度压到毫秒三种范式的演进主线就是从轮流说话逐步走向持续听说。Computer Use 把同一个闭环搬到屏幕上瓶颈已从能否完成任务扩展到操作效率、连续视觉理解和动作后的状态确认。机器人则把它推到物理世界动作分块在平滑性与反应速度之间取舍而最终是否完成仍必须由新的观察来判定。四节共享同一条控制骨架持续感知、判断当前状态与时机、选择回复或动作、让输出进入环境、观察反馈、继续或修正或重试或停止或重新规划。也共享同一组原语——唤醒、安全点、取消、抢占、快慢分离。这些原语在不同时间尺度上的实现差异主要由环境变化的速度、动作的可逆性和观察的获取成本决定。本文内容整理自开源技术书《深入理解 AI Agent》(bojieli/ai-agent-book)采用 Apache 2.0 许可证