
标题AVA-Encoder: Towards Agent-Native Video Representation Learning来源arXiv, 2608.12313v1️文章简介研究问题如何构建一种既忠实于电影内容又能被智能体直接理解、推理和编辑的结构化视频表示以解决创意智能体难以从高质量人类电影中学习的问题主要贡献论文提出了AVA-Encoder框架通过智能体自编码范式学习智能体原生的视频知识图谱表示显著提升了视频重建 fidelity 和下游生成质量。重点思路提出智能体视频自编码器AVA-Encoder范式将视频编码为以文本为中心的知识图谱KG包含故事-事件-镜头层级及关联资产层再通过固定解码器重建视频以重建误差作为优化信号。设计多层级智能体视频编码器按电影、镜头、关键帧三级由粗到细进行理解并通过上下文注入和注册表机制保持全局一致性与局部细节减少信息损失。引入双循环文本梯度进化机制外循环进行数据独立的编码策略伪训练优化共享的镜头级编码策略内循环进行数据依赖的KG表示细化在测试时针对特定输入优化图谱表示。建立基于重建忠实度的评估基准利用视觉语言模型生成原子事实问答作为优化奖励并设计防退化与防遗忘门控机制确保优化过程的稳定性与泛化能力。分析总结实验显示AVA-Encoder在整体重建准确率上达到49.0%比最强外部基线高出20.7个百分点在视频、关键帧及回溯描述等四个维度均表现优异。消融实验证明经过伪训练的共享编码策略优于人工调优策略且系统提示词令牌减少74.3%双循环结合使用比单独使用任一循环带来额外6.6个百分点的性能提升。知识图谱支持可控的链接编辑修改特定节点如角色身份或视觉风格能自动传播至相关镜头并保持语义一致性验证了表示的可操作性。该表示方法能有效提升下游多个创意智能体视频生成框架的故事视频质量证明了其作为通用中间表示的复用价值。个人观点论文将“重建忠实度”作为智能体表示学习的核心目标通过引入文本梯度和双循环优化解决了非结构化视频向结构化图谱映射中的信息丢失难题。