Inference Notes · 论文精读

English

← 全部笔记

Qwen3.8-Omni: Towards Native Omni-Modal Agents

Qwen Team · Not reported

在解决如何使全能模型能够执行诸如视频剪辑和分析等长周期多模态生产力任务,而不会因处理完整长度的视频而产生高昂的 Token 成本。

结论证明了将全能模型封装在原生智能体框架中可以大幅降低长视频的 Token 消耗并提高推理能力,尽管该模型在几项智能体和视频推理任务上仍落后于 Gemini 3.8 Flash,并且部分核心的多语言翻译能力略有倒退。

AgentInference
发表Not reported · arXiv 2609.25611 · 代码
精读于2026-09-23
可信度对机制和基准测试的胜利置信度高;由于缺乏硬件和服务的消融实验,对确切的成本降低声明置信度中等。
阅读范围Full LaTeX source, all 24 files incl. appendix given in full; 0 of 7 figures viewed by the reader
精读Gemini 3.1 Pro · 经独立审校

1. 任务

这篇论文解决的是什么问题:现有的全能模型难以支持复杂、长周期的多模态生产力工作流(如视频剪辑和电影生成),因为原生处理长视频输入的 Token 成本过高,并且现有的智能体框架缺乏对流式输入的支持。 为什么重要且困难:长视频包含海量的 Token。将完整视频直接输入模型上下文中会把 Token 浪费在无关帧上。此外,实时的多模态交互需要在严格控制延迟的同时,协调内存、工具和子智能体。 现有方法的不足:此前的智能体系统主要专注于基于文本的软件工程或 GUI 交互,仅将视觉/音频用作静态的一次性感知。它们无法动态浏览视频的时间轴或按需选择性地收集音视频证据。

2. 核心思路

Qwen3.8-Omni-Flash 不再是在单次 prompt 中被动输入完整的长视频和音频(这会导致 Token 爆炸),而是作为一个活跃的原生多模态智能体。它利用专用插件首先将长音视频输入抽象为文本摘要,然后根据需要延迟加载或检索特定的细粒度片段,从而在 100 万 Token 的上下文中高效地实现复杂的视频推理。

3. 机制 + 心智模型

  1. 架构: “Thinker” LLM(基于具有 1M 上下文的 Qwen3.8-Next 稀疏 MoE 架构)处理来自三个并行编码器的统一 Token:视觉(Vision)、通用音频 AuT(以 6.25 Hz 提取声学/语言特征)和空间音频 AuT(用于多通道空间线索)。
  2. 训练: 模型经过四个阶段的预训练流水线以对齐编码器并适应 QSA(Qwen Sparse Attention)。后训练阶段依赖多教师蒸馏(Multi-Teacher Distillation)来整合特定领域的能力(推理、编码、音频),随后进行统一的强化学习,以优化多轮任务结果和交互稳定性。
  3. Agentic 执行: 给定一个长视频,智能体调用 Qwen-MM-Plugins 生成粗略的摘要(通过 Omni-CaptionOmni-Video2Note)。然后,它制定计划并使用 Omni-Memory 选择性地查询和加载必要的音视频片段以进行详细分析,从静态处理转向主动的证据收集。
  4. 实时流式传输: “Talker” 模块接收来自 Thinker 的高层表征,并通过多 Token 预测(MTP)模块自回归地预测多码本序列(RVQ)。随后由因果 Code2Wav 解码器将其增量合成为 48kHz 音频,从而在完整文本生成前实现超低延迟响应。 心智模型: 长多模态上下文的 Token 过于密集,无法进行密集处理;因此,全能模型必须扮演“调查员”的角色,抽象完整的视频时间轴,并按需延迟加载特定的证据片段。

4. 指标 / 数据集

5. 对比 baseline

6. 开源

7. 关键数字核实

说法 出处 实际条件 成立? 备注
较 Qwen3.5-Omni-Plus 平均分提升 >25% 摘要 跨 29 项评估 ⚠️ 单项提升确实极大,但表格中并未直接计算/展示确切的 25% 平均值。
API 输入成本降低 >98% (音频), 93% (视频) 摘要 / §1 对比 Qwen3.5-Omni-Plus ⚠️ 正文中有提及,但未提供具体的成本/定价测量表格。
强大的编码和智能体文本能力 表 1 SWE-bench Pro 得分 63.3,击败了 Qwen3.8-Flash (62.5) 和 Claude-Opus (53.4)。
长视频理解表现最佳 表 2 LVBench 得分 76.9,击败 Qwen3.8-Flash 和 Claude-Opus-4.6 (Max)。(论文中并未提供 Gemini 3.8 Flash 在该测试中的成绩)。
多说话人 ASR 巨大提升 表 3 AliMeeting Test (DER) DER 降至 3.4,相较于 Qwen3.5-Omni-Plus (88.1) 是质的飞跃。
多模态工具调用表现优异 表 5 WildClawBench-MM ⚠️ 得分为 71.0,超越 Gemini 3.8 Flash (58.9),但在同一表格的其他智能体任务(AgenticVBench, OmniGAIA)中均不敌 Gemini。
智能体执行提升音视频理解 表 6 LVOmniBench (Qwen Code vs Static) 得分从 63.3 跃升至 73.6,在该特定数据集上反超 Gemini,但在 OmniVideoBench 和 Video-MME-v2 上仍落后于 Gemini。
降低长视频的 Token 消耗 表 7 OmniVideoBench 每次查询的 Token 从 145,736 降至 79,117,同时准确率提高。(作者注明这不代表端到端延迟或成本必定下降)。
实时交互的超低延迟 表 8 音频输入的 TTFC 音频 TTFC 约 1 秒,RTF 约 0.15。若是音视频输入,TTFC 增加至 1.21-1.35 秒。

8. 摘要没说的

9. 可达性与启发

10. 置信度与下一步

11. 审校记录