OpenAI 首款 AI 硬件曝光:甜甜圈形状无屏智能音箱 300–400 美元;OpenAI 与 Pion 合作构建 Go 语言 Opus 解码器丨日报

发布时间:2026/8/9 2:20:09
OpenAI 首款 AI 硬件曝光:甜甜圈形状无屏智能音箱 300–400 美元;OpenAI 与 Pion 合作构建 Go 语言 Opus 解码器丨日报 本期编辑三水、鲍勃01 有话题的技术1、阿里发布 AI 语音平台 CosyVoice Studio集成语音记录、语音智能体与音频创作能力阿里巴巴推出一站式 AI 语音平台 CosyVoice Studio基于自研语音模型 Qwen-Audio 构建整合语音记录、实时语音智能体和 AI 音频创作三类能力。平台包含 CosyFlow、CosyAgent 和 CosyCreative 三个功能模块覆盖语音输入、交互和内容生成场景。语音记录工具 CosyFlow 支持语义理解与结构化整理CosyFlow 在语音转文字基础上增加语义理解和文本生成能力可自动去除口语填充词并将录音内容整理为邮件、汇报、会议纪要等结构化文本。支持多人会议录音与智能摘要CosyFlow 内置“随记”功能支持实时录制和离线上传可通过声纹区分不同发言人并自动生成章节结构和摘要。语音智能体平台CosyAgent支持自然语言创建 Voice Agent用户可通过自然语言创建具备企业知识、工具调用和实时语音交互能力的智能体同时兼容 Prompt 与 Workflow 配置用于智能客服、电话营销等场景。音频创作工具 CosyCreative 支持文档转播客与有声内容用户上传文档、网页链接或文本后可生成对话播客、多角色有声书等内容并支持声音复刻与多种音色选择。国内首个AI语音平台CosyVoice Studio上线(阿里语音AI)2、字节跳动发布多说话人语音生成模型SwanTale面向多说话人与复杂音频场景生成支持指令控制与零样本语音生成字节跳动 SwanAIGC 团队发布 SwanTale一种面向多说话人语音与音频生成的统一模型支持指令驱动Instruct和零样本Zero-Shot两类生成任务。该模型通过统一架构处理多说话人语音、环境音频等生成需求并提供对应技术报告与 Demo。支持 Instruct 与 Zero-Shot 两类音频生成任务SwanTale 可根据自然语言指令生成包含环境描述、说话人风格和细粒度内容控制的音频也支持结合参考音频完成零样本生成。采用统一多模态音频生成架构模型引入 SwanVAE 支持多音频模态生成并结合 Unified MoE 处理多任务与多音频模态建模。加入数据与训练策略优化项目提出 SwanData-Caption 数据构建流程通过清洗语音和音频数据、补充合成数据并生成多层级描述标注用于训练。模型训练阶段结合奖励条件质量控制、Engram 条件控制、课程学习和 GRPO 后训练。覆盖复杂多说话人生成场景实验结果显示SwanTale 在多项 Instruct 和 Zero-Shot 评测指标中取得较好表现并支持包含多说话人语音与音频元素的复杂指令生成。https://arxiv.org/abs/2608.02023https://swanaigc.github.io/(SwanAIGC)3、OpenAI 与 Pion 合作构建 Go 语言 Opus 解码器用于 GPT-Live 全双工语音系统https://github.com/pion/opus(jubertiX)02 有亮点的产品1、千问 App 更新语音通话能力支持多场景连续语音交互千问 App 更新语音通话功能新增 7×24 小时在线语音陪伴能力覆盖互动陪玩、睡前故事、带娃讲题、语音打车等场景。此次更新重点提升语音交互体验包括更自然的声音表现和面向不同场景的对话能力。今天千问功能上新千问2、OpenAI 首款 AI 硬件曝光甜甜圈形无屏幕智能音箱预计售价 300–400 美元OpenAI 计划推出一款外观像甜甜圈的新型智能硬件设备。该产品被定位为「AI 原生计算机」预计将于明年正式发布售价可能在 300 美元至 400 美元之间约合人民币 2150 元至 2870 元。该设备由 OpenAI 与 Jony Ive 创办的 LoveFrom 工作室合作设计。其外观呈圆环状尺寸与冰球相当采用高品质金属材质旨在方便用户单手握持并在家中随身携带。与传统的智能音箱不同该设备不配备显示屏但包含可移动的机械部件。这些部件能够根据交互状态自主摆动以赋予设备类似于「生命」的个性化反馈。https://www.bloomberg.com/news/articles/2026-08-06/what-is-openai-s-device-a-doughnut-shaped-speaker-that-costs-over-300(Bloomblerg)3、UNITH 发布 DEVA-1 Alpha根据语音情绪、语调与节奏实时驱动数字人面部表情UNITH 推出 DEVA-1 AI 数字人模型面向实时数字人交互场景重点提升面部表情、微表情和情绪表达能力。该模型通过实时生成完整面部表现使数字人从传统口型同步和预制动画转向更自然的动态表情交互。(unith.ai)实时生成面部表情与情绪变化DEVA-1 不仅驱动嘴部动作和语音同步而是实时生成完整面部状态包括表情变化、微动作和情绪表达用于增强数字人的自然交互能力。从语音驱动动画升级为 AI 原生数字人表现层传统数字人通常依赖固定动作库或嘴型匹配DEVA-1 聚焦面部动态生成让数字人能够根据对话内容呈现更加连续的视觉反馈。支持企业级交互式数字人部署UNITH 平台提供数字人创建、API 集成和工作流接入能力可将数字人嵌入网站、应用和企业业务流程用于客服、培训、销售和内部协作场景。结合语音克隆与数字人定制能力平台支持创建自定义数字人包括面部形象、声音以及交互行为配置可用于品牌代表、培训角色和虚拟助手等场景。https://www.unith.ai/lp/deva-1(UNITH)4、Omilia 完成 6700 万美元 B 轮融资扩展 AI 客户服务平台与语音智能体能力Omilia 完成 6700 万美元 B 轮融资由 Expedition Growth Capital 领投用于扩展其 AI 客户服务平台业务。该公司长期专注语音客服自动化并正在构建覆盖不同客户触点的自学习智能体平台。融资 6700 万美元用于全球扩张本轮融资由 Expedition Growth Capital 领投Omilia 表示将利用资金扩大北美市场业务和商业团队公司自 2020 年融资以来 ARR 增长至 6000 万美元。公司计划利用资金扩大北美市场业务和商业团队。构建自学习客户服务智能体Omilia 正从传统语音客服自动化扩展到可跨客户触点工作的自学习智能体平台覆盖电话、聊天和消息等交互渠道。ARR 增长至 6000 万美元自 2020 年融资以来年度经常性收入ARR增长 10 倍达到 6000 万美元。语音 AI 已部署于企业客服场景Omilia 客户包括 Capital One、Discover、RBC、DWP、PSEG 等企业并已在 Taco Bell 超过 1000 家门店部署语音点单技术。(TechCrunch)03 有态度的观点1、字节讨论训超 5 万亿参数模型张一鸣不蒸馏、别被 Coding 这种短期热点影响字节跳动创始人张一鸣近日在 Seed 团队会议上表示即使公司暂时落后于竞争对手也不会依赖 AI 蒸馏技术来改进自身模型而是坚持通过自主研发提升模型能力。所谓「蒸馏」通常指利用更先进模型的输出结果训练另一个模型以较低成本获得接近前沿模型的能力。这种方式已经成为行业中提升模型性能的重要手段但也引发了关于模型创新和能力来源的讨论。当前 AI 竞争正在从单纯追求模型参数规模转向数据、训练方法、基础设施和长期研发能力的综合竞争。相比快速复制已有能力如何建立持续迭代的模型研发体系可能决定下一阶段 AI 公司的竞争壁垒。值得注意的是模型蒸馏本身已经成为行业普遍采用的方法。包括 Anthropic 在内的多家 AI 公司都曾指控其他机构可能对其模型进行蒸馏但这一技术路线仍存在大量争议。张一鸣的判断背后是对 AI 长期竞争逻辑的另一种理解真正的领先优势不只是获得当前最强模型的能力而是持续创造下一代模型的能力。 latepostnewsX Voice Agent 学习笔记了解最懂 AI 语音的头脑都在思考什么写在最后我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创感兴趣的朋友请通过开发者社区或公众号留言联系记得报暗号「共创」。对于任何反馈包括但不限于内容上、形式上我们不胜感激、并有小惊喜回馈例如你希望从日报中看到哪些内容自己推荐的信源、项目、话题、活动等或者列举几个你喜欢看、平时常看的内容渠道内容排版或呈现形式上有哪些可以改进的地方等。作者提示: 个人观点仅供参考