Skip to Content
OmniOmni Model2026Qwen3.5-Omni Technical Report

Qwen3.5-Omni Technical Report

论文链接:https://arxiv.org/pdf/2604.15804 

代码链接:https://huggingface.co/spaces/Qwen/Qwen3.5-Omni-Online-Demo 

摘要

本文介绍了 Qwen3.5-Omni,它是 Qwen-Omni 模型家族的最新进展。Qwen3.5-Omni 相较于其前代产品有了显著的提升,可扩展至数千亿参数,并支持 256k 的上下文长度。该模型利用包含异构文本-视觉对和超过 1 亿小时音视频内容的海量数据集,展现了强大的全模态能力。Qwen3.5-Omni-Plus 在 215 项音频和音视频理解、推理和交互子任务及基准测试中均取得了 SOTA 最佳结果,在关键音频任务中超越了 Gemini-3.1 Pro,并在综合音视频理解方面与之匹敌。在架构方面,Qwen3.5-Omni 的 Thinker 和 Talker 都采用了混合注意力专家混合 (MoE) 框架,从而实现了高效的长序列推理。该模型支持复杂的交互,可处理超过 10 小时的音频理解和 400 秒的 720P 视频(1 帧/秒)。为了解决流式语音合成中固有的不稳定性和非自然性问题(通常是由于文本和语音 tokenizer 之间的编码效率差异造成的),我们引入了 ARIAAdaptive Rate Interleave Alignment)。ARIA 可动态对齐文本和语音单元,显著提升对话语音的稳定性和韵律,同时将延迟影响降至最低。此外,Qwen3.5-Omni 扩展了语言边界,支持 10 种语言的多语言理解和语音生成,并能呈现类人般的细微情感。除了预设语音外,该模型还支持通过用户提供的样本进行零样本语音定制。最后,Qwen3.5-Omni 展现出卓越的视听融合能力,能够生成具有精确时间同步和自动场景分割的脚本级结构化字幕。值得注意的是,我们观察到全模态模型中出现了一种新功能:直接基于视听指令进行编码,我们称之为 Audio-Visual Vibe Coding。Qwen3.5-Omni 可通过 API 公开访问。

1.Introduction

人类与世界的互动本质上是全模态且具有能动性的,它涉及视觉、听觉和语言信息的整合,并通过文本、语音和目标导向的工具辅助行为产生响应,从而促进与其他生物的信息交换并展现智能。基于大型模型在文本、视觉和音频理解与推理能力方面的快速发展,能够跨所有模态进行联合处理和生成的原生全模态系统已引起广泛关注。然而,现有模型主要运行在被动的感知-响应范式中,在可扩展的主动行为、实时交互、自主工具使用和跨模态推理方面能力有限,而这些正是实际部署的必要前提。

本报告介绍了 Qwen 最新一代全模态 LLM Qwen3.5-Omni,该模型支持对文本、图像、音频和视听内容的理解。Qwen3.5-Omni 采用全模态方式,在海量文本、视觉数据以及超过 1 亿小时的视听数据上进行原生预训练,被设计为原生全模态智能体模型:它不仅能够跨所有模态感知和推理,还能自主行动,例如调用 WebSearch、执行复杂的函数调用、生成语音输出以及进行实时流式交互。该模型系列包含 Plus 和 Flash 版本,支持 256k 长上下文输入。

Qwen3.5-Omni 基于 Qwen2.5-Omni 中引入的 Thinker-Talker 架构,并针对 Qwen3-Omni 进行了五项关键技术升级:(1) Thinker 和 Talker 都采用了混合注意力专家混合模型 (MoE) 设计,从而实现了高效的推理;(2) 支持高达 256k 个 token 的长上下文建模,支持超过 10 小时的音频和超过 400 秒的 720P 音视频内容(帧率为 1 FPS);(3) 在语音生成方面,多码本编解码器表示实现了单帧即时合成;(4) Talker 引入了 ARIA 技术,该技术可在流式解码期间动态对齐文本和语音单元,从而显著提高自然度和鲁棒性;(5) 多语言训练得到了大幅扩展,语音识别支持 ​​113 种语言和方言,语音合成支持 36 种语言和方言。

得益于这些技术进步,Qwen3.5-Omni 相较于 Qwen3-Omni 提供了三大主要新功能:(1) 可控的audio-visual captioning,能够生成可控、详细且结构化的字幕,以及剧本级别的精细描述,包括自动分割、时间戳注释以及对角色及其与音频关系的详细描述;(2) 全面的实时交互,包括通过原生 turn-taking 意图识别进行语义打断、对音量、速度和情绪进行端到端的语音控制,以及从用户提供的样本进行语音克隆;(3) 原生全模态 Agent 行为,包括自主网络搜索和复杂的函数调用,以及视听氛围编码,这是一种新兴功能,其中模型直接从视听指令生成可执行代码,使模型能够在无需外部协调的情况下响应实时查询。

至关重要的是,Qwen3.5-Omni 在文本和视觉模态上保持了最先进的性能,与同等大小的单模型 Qwen 相比,性能没有下降。在涵盖视听基准测试、音频基准测试、自动语音识别 (ASR) 基准测试、特定语言的语音转文本翻译任务以及特定语言的 ASR 任务的 215 项音频和视听理解、推理和交互子任务及基准测试中,Qwen3.5-Omni-Plus 取得了 SOTA 级别的结果,在通用音频理解、推理、识别、翻译和对话方面超越了 Gemini-3.1 Pro,而其整体视听理解能力则达到了 Gemini-3.1 Pro 的水平。

2.Architecture

2.1 Overview

如图 2 所示,Qwen3.5-Omni 继续采用 Thinker-Talker 架构。与 Xu et al. (2025b) 的 Qwen3-Omni 相比,Qwen3.5-Omni 在可扩展性、对齐性和实时交互方面引入了几项关键改进:

  • 整体骨干网采用混合专家(MoE)设计,提高了可扩展性,同时更好地平衡了多模态理解和生成的能力和效率。
  • Thinker 分别通过视觉编码器和 AuT 接收视觉和音频信号。音频和视频输入交错处理,实现统一的多模态建模,并插入显式时间戳以提升时间感知能力,尤其适用于长视频或音视频场景。这种设计使 Thinker 能够处理扩展输入,支持高达 256k 个 token、10小时音频或 400 秒 720P、1FPS 的视频。
  • Talker 负责生成上下文相关的语音,它基于多模态输入以及 Thinker 的文本输出进行条件判断。Qwen3.5-Omni 采用了 Qwen3-Omni 中引入的基于 RVQ 的语音表示方法,这显著提高了推理效率。
  • 为了支持实时交互,Qwen3.5-Omni 在 Thinker 中采用了分块流式输入处理,并在 Talker 中采用了流式设计,从而实现了低延迟的端到端多模态对话。
  • 与 Qwen3-Omni 的双轨语音输入设计不同,Qwen3.5-Omni 的语音输入采用 ARIA 技术,在交错输入文本和语音单元之前动态对齐它们。这种设计缓解了文本和语音分词率不匹配导致的不稳定性,从而减少了漏词、发音错误和数字显示不清晰等问题

在接下来的章节中,我们首先介绍 AuT 编码器及其训练方法。然后,描述 Thinker 如何处理各种输入。接下来,我们详细介绍 Talker 的多码本流式语音生成。最后,我们重点介绍理解模块和生成模块的一系列改进,旨在实现超低延迟的端到端流式音频推理。

2.2 Audio Transformer (AuT)

如图 3 所示,我们在注意力编码器-解码器模型(AuT)中使用了从零开始训练的基于 Transformer 的音频编码器。Qwen3.5-Omni 编码器的训练消耗了由 Qwen3-ASR 生成的 4000 万小时音文本对数据。音频的滤波器组特征使用 4 个 Conv2D 层进行 16 倍下采样,然后输入到自注意力层,以获得 6.25Hz 采样率的音频 token。与 Qwen3-Omni 编码器的训练过程相比,Qwen3.5-Omni 编码器适应了 20 多种语言的多语言数据,中文、英文和多语言数据的比例为 3.5:3.5:3。为了保证在实时预填充缓存和离线音频理解任务下推理性能的平衡,我们采用了动态注意力窗口大小的训练机制。

2.3 Perceivation

Text, Audio, Image and Video (w/o Audio)。Thinker 将文本、音频、图像和无声视频输入转换为统一的表示序列。对于文本,我们使用 Qwen3.5 tokenizer,它采用字节级字节对编码,词汇量从 15 万提升至 25 万,在大多数语言上将编码和解码效率提高了 10% 到 60%。对于音频输入(包括从视频中提取的音频),我们将波形重采样至 16 kHz,并使用 25 毫秒的窗口和 10 毫秒的步长大小将其转换为 128 通道的梅尔频谱图。我们使用 AuT 作为音频编码器,该编码器基于 4000 万小时的音频数据从头开始训练,其中每个输出帧对应于原始信号约 160 毫秒。对于视觉输入,我们采用 Qwen3.5 的视觉编码器来处理图像和视频。该编码器基于图像和视频混合数据进行训练,在图像理解和视频理解方面都表现出强大的能力。为了在保持与音频流同步的同时尽可能保留视频信息,我们以动态帧速率对视频帧进行采样。

Audio-visual Timestamp。继 Qwen3-Omni 之后,我们应用 TM-RoPE 为模型赋予时间感知能力,以实现音视频同步。然而,我们发现直接通过时间位置 ID 编码绝对时间会导致长视频或音视频输入的索引过于稀疏,从而削弱长距离时间建模能力。此外,这种设计通常需要大规模且均匀分布在不同帧速率上的训练样本,增加了数据构建成本。为了解决这些问题,我们在每个视频或音视频时间块前添加一个显式时间戳,该时间戳以格式化的文本字符串形式表示,单位为秒,使模型能够更自然地学习时间码表示。对于音频序列,我们进一步以随机间隔插入时间戳,以提高跨模态的时间对齐。虽然这种策略略微增加了上下文长度,但它提供了更精确、更鲁棒的时间感知,尤其适用于长上下文多模态输入。

在多模态视听流的上下文中,音频分量以每 160 毫秒一个时间 ID 进行编码。视频被视为一系列帧,其时间 ID 单调递增,并根据实际时间戳动态调整,以确保每个 ID 的时间分辨率始终为 160 毫秒。视频帧的高度和宽度 ID 的分配方式与静态图像相同。为了防止处理多种模态时出现位置冲突,位置编号采用连续编号,每个后续模态的编号都从 1 加上前一个模态的最大位置 ID 开始。这种改进的位置编码方法使模型能够有效地整合和联合建模来自不同模态的信息。Qwen3.5-Omni 使用时间 ID 对这些表示进行对齐,这些时间 ID 明确锚定于绝对时间。这种设计选择使模型能够灵活地支持任意持续时间的流式输入。

2.4 Speech Generation

Talker 直接处理由 Qwen3.5-Omni-Audio-Tokenizer 生成的 RVQ token。为了对残差码本进行建模,它采用了一个多 token 预测 (MTP) 模块,该模块能够对声学细节进行精细建模和控制。结合用于波形重建的因果卷积神经网络 (ConvNet),Talker 能够以较低的推理延迟和适中的计算开销实现高保真语音合成。

在多轮口语对话中,Talker 会根据 Thinker 组件提供的丰富上下文信息进行调整,这些信息包括历史文本 token、多模态表征以及当前回合的文本流。这种调整使得 Talker 能够根据不断变化的对话上下文动态地调节其声学属性,例如韵律、响度和情感。

在架构上,我们的方法与 Xu et al. (2025b) 的方法有两个关键区别。

  1. 首先,我们为 Talker 引入了一个专用的系统提示,用于指定目标语音特征,从而实现零样本语音克隆和可控语音生成。与传统的说话人嵌入相比,该提示可以编码更丰富的多模态线索,包括文本描述和编解码器序列,从而对声学实现进行更精细的控制。
  2. 其次,我们提出了 ARIA(自适应速率交错对齐),它将传统的双通道生成范式(同时生成两种类型的 token,即文本 token 和语音 token)统一为单通道形式。ARIA 不依赖于 MFA 导出的对齐或固定的交错速率,而是强制执行自适应速率约束:对于生成序列的任何前缀,累积语音到文本 token 的比例不得超过相应的项目级全局比例。尽管设计简单,但这种设计能够灵活地实现跨语言的文本-语音对齐,包括那些编码效率相对较低的语言,并且自然地支持任意文本 token 前缀,后跟连贯的语音 token 延续。

2.5 Designs for Streaming and Concurrency

在流式音视频交互场景中,首包延迟是影响用户体验的关键因素,而模型的并发能力是降低服务成本和提升响应速度的关键。本节将探讨 Qwen3.5-Omni 如何通过算法和架构优化来增强并发能力并降低首包延迟。

Chunked Prefilling and Hybrid MoE Architecture。在 Qwen3.5-Omni 中,我们保留了 Qwen3-Omni 和 Qwen2.5-Omni 中实现的块预填充机制,其音频和视频编码器能够沿时间维度输出块。这种方法显著降低了 Thinker 和 Talker 的首 token 到达时间 (TTFT)。在架构上,Qwen3.5-Omni 中的 Thinker 和 Talker 都基于 Qwen3.5 中引入的混合 MoE 架构。除了混合 MoE 本身具有的效率优势外,该架构还包含门控 Delta 网络 (GDN) 模块,该模块在加速长音视频序列建模方面尤为有效。因此,它显著降低了长上下文推理中的 key-value 缓存 I/O 开销,提高了生成吞吐量并实现了更高的服务并发性。

Streaming Generation with ARIA。对于流式语音生成和高并发服务,Qwen3.5-Omni 在很大程度上继承了 Qwen3-Omni 的高效设计:Talker 使用轻量级 MTP 模块预测 RVQ 编解码器 token,生成的多码本 token 通过因果流式 ConvNet 编解码器转换为波形。这些组件保持了计算量小、易于批量处理且非常适合低延迟部署的特点。基于此共享基础,先前引入的 ARIA(自适应速率交错对齐)进一步将 Qwen3-Omni 中的双通道生成模式重构为统一的文本和语音 token 交错单流格式。通过在单调交错约束下组织文本和语音生成,ARIA 降低了不同生成轨道之间的同步开销,实现了解码过程中更高效的 token 调度,并更好地匹配了流式交互的自然增量机制

3.Pretraining

Qwen3.5-Omni 的预训练数据集涵盖多种语言和方言(如表 3 所示)以及多种模态,包括图像-文本、视频-文本、音频-文本、视频-音频、视频-音频-文本和纯文本语料库。与 Qwen3-Omni 的研究类似,我们采用了更广泛的自然语言提示,以增强模型的泛化能力和指令遵循能力。为了在所有模态上实现稳健的性能,我们的训练策略在早期预训练阶段就融合了单模态和跨模态数据

在 Qwen3-Omni 中,我们采用 TMRoPE 为模型赋予时间感知能力。然而,我们发现这种方法存在两个关键局限性:(1) 通过将时间位置 ID 直接与绝对时间关联,对于较长的音视频或视频输入,它会产生过大且稀疏的时间位置 ID,从而削弱模型捕捉长距离时间上下文的能力。(2) 在这种方案下进行有效学习通常需要对不同帧率 (fps) 进行大规模且均匀分布的采样,这显著增加了训练数据构建的成本。为了解决这些问题,我们在每个视频或音视频时间块前添加一个时间戳,该时间戳以格式化的文本字符串形式表示(单位为秒),使模型能够更好地学习和解释时间码表示。此外,对于音频序列,我们以随机间隔插入时间戳,以更好地协调不同模态的训练。虽然这种方法略微增加了上下文长度,但它使模型能够更有效、更精确地感知时间信息。

Qwen3.5-Omni 的预训练分为三个阶段。第一阶段,我们锁定 LLM 参数,专注于训练视觉和音频编码器,利用庞大的音文本和图像文本对语料库来增强 LLM 的语义理解能力。第二阶段,我们解冻所有参数,并使用更广泛的多模态数据进行训练,以进行更全面的学习,序列长度为 32,768。在最后阶段,我们使用序列长度为 262,144 的数据来增强模型理解复杂长序列数据的能力。

  1. Encoder Alignment Stage (S1)。在初始预训练阶段,Qwen3.5-Omni 的 LLM 组件使用 Qwen3.5 的参数进行初始化,视觉编码器也采用 Qwen3.5 的参数,而音频编码器则使用 AuT 的参数进行初始化。这两个编码器在固定的 LLM 上分别进行训练,并且都首先专注于训练各自的 adapter,然后再训练编码器。
  2. General Stage (S2)。预训练的第二阶段使用了一个包含约 4T token 的大规模数据集,其模态分布如下:文本(0.92T)、音频(1.99T)、图像(0.95T)、视频(0.14T)和音视频(0.29T)。在此阶段,引入更多样化的多模态数据和任务,增强了模型对听觉、视觉、文本和视听信息的理解和交互能力。
  3. Long Context Stage (S3)。在最终预训练阶段,我们将最大 token 长度从 32,768 增加到 262,144,并提高了训练数据中长音频和长视频的比例。实验结果表明,这些调整显著提高了模型理解长序列数据的能力。

4. Post-training

4.1 Thinker

后训练阶段采用三阶段策略来优化 Thinker 模型,旨在保持模型在所有模态下的能力不下降,确保在音频 query 下提供高质量的响应,并优化整体交互体验。训练语料库采用 ChatML 格式,包含纯文本、视觉、音频和混合模态的对话数据。具体而言,该过程包含以下几个阶段:

  • Stage 1: Specialist Distillation。为了构建强大的全模态能力基础,我们首先通过独立的有监督微调(SFT)和强化学习(RL)训练了一系列领域特定的教师模型。所有教师模型均基于预训练的 Qwen-3.5 基础检查点进行微调。除了文本相关任务(包括智能体任务、编码任务和基础推理任务)之外,我们还训练了视觉和音频领域的专用教师模型。这些教师模型用于生成特定领域的数据,从而可以将每个领域中学习到的专用能力蒸馏到一个统一的模型中。
  • Stage 2: On-Policy Distillation。通过上述的专家蒸馏,该模型在多模态理解与推理、文本对话、推理、编码和智能体任务等领域已取得优异的性能。然而,基于音频 query 的响应质量与基于文本 query 的响应质量之间仍然存在显著差距。为了缩小这一差距,我们引入了 on-policy 蒸馏的第二阶段训练流程,旨在将模型在文本输入下更强的响应能力蒸馏到音频输入场景中。具体而言,对于每个音文配对 query,我们首先获取一个在文本条件下生成的响应,该响应通常在流畅性、推理能力和任务完成度方面表现更佳。然后,我们将该响应作为相应音频条件 query 的蒸馏目标。通过对这些策略目标进行训练,模型逐步使其音频条件输出与文本条件行为保持一致,从而提高音频输入下的响应质量,并促进模态一致性生成。
  • Stage 3: Interaction-Aligned Reinforcement Learning。尽管前两个阶段显著提升了模型的领域能力和跨模态响应质量,但仍不足以使其完全优化以适应真实世界的交互应用。在多轮对话中,我们观察到一些交互特有的问题,包括无意的语言代码切换、角色不一致以及在较长语境下指令执行能力下降。为了缓解这些问题,我们引入了交互对齐强化学习(Interaction-Aligned RL),这是一个旨在优化模型交互质量的第三阶段强化学习过程。我们构建多轮交互轨迹,并围绕这些用户体验目标设计奖励信号,使模型能够在长时间的交互中学习到更稳定、更一致、更协调的行为。通过显式地优化交互质量,该阶段提高了模型在实际对话场景中的整体可用性。

4.2 Talker

我们为 Talker 采用了四阶段训练流程,使 Qwen3.5-Omni 能够生成自然且符合语境的语音回复,并能与文本结合使用。所有训练数据均以 ChatML 格式组织,以保持与 Thinker 的一致性,并方便语音克隆。

  1. General Stage。在初始预训练阶段,我们使用超过 2000 万小时的多语言语音数据(包含多模态上下文)对 Qwen3.5-Omni 进行训练。尤其值得一提的是,引入更多样化的任务,例如指令跟随语音生成,显著提升了上下文推理和副语言对齐能力,超越了从多模态表征到语音的简单单调映射。
  2. Long-Context Stage。我们通过专门的数据筛选流程进行数据质量分层,并在高质量子集上进行持续预训练 (CPT)。借助 Qwen3-Omni-Captioner,该阶段可以减轻初始预训练阶段噪声数据带来的干扰,并显著提高生成语音的自然度和质量。同时,我们将最大上下文长度扩展到 64k 个token,使模型能够更好地处理冗长复杂的用户输入,并生成更具上下文关联的语音响应。
  3. Reinforcement Learning Stage。我们通过直接偏好优化(DPO)进一步使模型行为与人类偏好保持一致。具体而言,我们基于人工标注构建多语言偏好对,并使用 DPO 优化模型。此外,我们引入基于规则的奖励机制,并采用 GSPO算法,以进一步提升模型在各种任务中的整体能力和训练稳定性。
  4. Speaker Fine-tuning Stage。最后,我们在基础模型的基础上进行轻量级的说话人微调,使 Qwen3.5-Omni 能够忠实地捕捉目标说话人的特征,同时进一步提高其语音输出的自然性、表现力和可控性。

5.Evaluation

我们对 Qwen3.5-Omni-Flash 和 Qwen3.5-Omni-Plus 这两个模型变体进行了全面评估。评估结果分为两大类:文本理解(X→Text)和语音生成(X→Speech)。

Last updated on