MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
论文链接:https://arxiv.org/pdf/2604.27393
代码链接:https://github.com/OpenBMB/MiniCPM-o
摘要

多模态大语言模型(MLLM)的最新进展已将人工智能能力从静态离线数据处理扩展到实时流式交互,但距离人类水平的多模态交互仍有较大差距。关键瓶颈不再仅仅是模态覆盖范围或延迟,而是交互范式本身。(1)首先,感知和响应仍然分离在交替的阶段,这使得模型无法在生成过程中及时整合新的输入进行调整。(2)其次,大多数现有模型仍然是被动的,仅响应用户的明确请求,而不是在不断变化的多模态环境中主动行动。我们提出了 MiniCPM-o 4.5,这是我们为实现类人多模态交互所做的最新努力,它通过实时全双工全模态交互来弥补这些差距。它可以实时地同时进行视觉、听觉和语言表达,并根据对实时场景的持续理解,展现出诸如发出提醒或评论等主动行为。MiniCPM-o 4.5 背后的关键技术是 Omni-Flow,这是一个统一的流式框架,它将全模态的输入和输出沿着共享的时间轴对齐。这种模型将传统的基于轮次的交互方式转变为全双工、时间对齐的过程,从而实现同步感知和响应,并允许在同一框架内产生主动行为。MiniCPM-o 4.5 拥有 9B 参数,在视觉语言能力方面接近 Gemini 2.5 Flash,在其规模下实现了最先进的开源性能。它在全模态理解方面也超越了 Qwen3-Omni-30B-A3B,并提供了更佳的语音生成效果,同时显著提高了计算效率。凭借其高效的架构设计和推理优化,该模型能够在占用不到 12GB RAM 的边缘设备上执行实时全双工全模态交互。更重要的是,MiniCPM-o 4.5 可以被视为一个极具前景的趋势的代表(图 2):多模态基础模型正朝着类人交互范式发展,有望在不久的将来与动态的全模态世界进行互动。

1.Introduction

多模态大语言模型(MLLM)的进步使得图像、语音、视频和文本之间的交互日益丰富,从而使人工智能系统更接近自然的交流方式(图2)。如今,实现类人交互的主要挑战不再仅仅是模态覆盖范围或响应延迟,而是底层交互范式本身。在当前的模型中,感知和响应仍然局限于交替的阶段,这使得在生成过程中难以持续地整合新到达的信息以进行及时调整,如图3所示。此外,模型的行为仍然严格地由请求驱动,而不是从不断演变的多模态环境中主动发起。
应对这一挑战需要超越基于轮次的被动响应生成模式,转向持续主动的交互。首先,感知和响应应在 token 级别上持续耦合,从而使听、看、说、写能够并行进行,而不是被迫串行执行。其次,交互应更加上下文驱动,而非纯粹被动响应。更接近人类的模型不应等待用户明确触发,而应能够根据持续的上下文启动相应的行为,例如提供实时场景描述或提醒。这在长期辅助和环境交互中尤为重要。
我们隆重推出 MiniCPM-o 4.5,这是我们在类人多模态交互领域的最新成果。它能够实时同步地进行视觉、听觉和语音交互,并能根据对实时场景的持续理解,展现出主动行为,例如发出提醒或评论。该模型的核心技术是 Omni-Flow,这是一个统一的流式框架,它将多模态的输入和输出沿着共享的时间轴进行对齐。Omni-Flow 并非将交互视为一系列独立的轮次,而是将其构建为一个连续的全双工过程,其中感知和响应并行展开,主动行为可以从同一交互循环中持续的上下文信息中涌现。为了在训练过程中充分利用丰富的全模态知识,MiniCPM-o 4.5 基于端到端的多模态架构构建,该架构具有 token 级的连续连接。此外,我们还设计了一种时间对齐的交错语音生成策略,确保输出语音与并发环境上下文紧密同步。
为了更好地兼容现有基础设施和应用,MiniCPM-o 4.5 还支持传统的轮流交互模式,并可在全双工全模态流模式和传统使用模式(类似于 MiniCPM-o 2.6 和 MiniCPM-V 4.5,但性能有所提升)之间灵活切换。广泛的评估表明,该模型在视觉语言和全模态能力方面处于领先地位。其总共拥有 9B 参数,在视觉语言能力方面接近 Gemini 2.5 Flash,在其规模下实现了最先进的开源性能。在全模态理解方面,它超越了 Qwen3-Omni-30B-A3B,并提供了更高质量的语音生成。凭借其端到端的连续连接,MiniCPM-o 4.5 可以接收包含文本和参考音频的多模态系统提示,从而支持语音克隆等高级语音生成功能。此外,MiniCPM-o 4.5 保留了 MiniCPM 系列的强大视觉优势,包括强大的 OCR、低幻觉和多语言支持。
我们的贡献有三方面:(1) 我们提出了 MiniCPM-o 4.5 9B,这是首个全双工全模态大语言模型 (LLM)。它可以在内存小于 12GB 的边缘设备上高效运行。(2) 大量的评估表明,MiniCPM-o 4.5 在视觉语言能力方面接近 Gemini 2.5 Flash,并在其规模下实现了最先进的开源性能。它在全模态理解和语音生成质量方面也超越了 Qwen3-Omni-30B-A3B,并且计算效率显著更高。(3) 我们认为连续的全双工主动式多模态交互是实现更类人交互智能的关键步骤,并提出了 Omni-Flow 框架,该框架将多模态输入和输出沿共享的时间轴对齐,以实现全双工交互建模。
2.End-to-End Omni-Modal Architecture

MiniCPM-o 4.5 基于端到端的全模态架构,支持 Omni-Flow 下的全双工交互和传统的基于轮次的推理。如图 4 所示,它包含三个主要组件:(1)以流式方式处理视觉和音频输入的多模态编码器;(2)执行全模态理解和文本生成的 LLM 骨干网络;以及(3)语音解码器,包括一个自回归生成离散语音 token 的交错式语音 token 解码器和一个将语音 token 转换为音频波形的 flow-matching 解码器。所有可学习组件——从多模态编码器到 LLM 骨干网再到语音 token 解码器,总计约 9B 参数——在 token 级别上可微分连接,从而在训练过程中实现端到端梯度传播和跨模态联合优化。详细的架构配置见附录 A。
Visual Encoding。MiniCPM-o 4.5 采用 LLaVA-UHD 图像分割策略,对任意宽高比的高分辨率图像进行编码,并利用重采样模块提高压缩率。我们采用 448×448 的最大分辨率用于全双工流模式,其他模式下则采用 2240×2240 的最大分辨率。具体来说,每幅图像首先被分割成多个切片,然后每个切片通过 SigLIP ViT (0.4B) 编码成 1024 个 token,最后通过重采样模块压缩成 64 个 token。这样就实现了 16 倍的 token 压缩比,高于常见的 4 倍压缩,从而显著提高了视觉处理效率。
Audio Encoding。Whisper Medium 编码器(0.3B)以基于块的流式传输方式对输入音频进行编码,每秒生成 50 个特征 token。然后,我们使用双层 MLP 投影仪进行 5 倍时间压缩,最终得到 LLM 主干网每秒 10 个音频 token,从而降低了 token 预算。
Text Decoding。LLM 骨干网(Qwen3-8B)负责生成用于语音生成的文本输出和隐藏状态。由于 LLM 骨干网仅生成文本域的 token,因此在实时全双工交互过程中,它每秒只需 3-4 个解码步骤(即人类语速)。然而,当骨干网需要直接生成语音 token(通常约为每秒 25 个 token)时,例如在近期的一些工作中,效率会显著降低,并且核心语言功能也会受到影响。我们的设计通过将语音 token 生成委托给下文所述的轻量级语音解码器来避免这种情况。
Speech Token Generation。语音生成不仅要求发音正确,还要求韵律和风格受上下文和指令的影响。我们利用 LLM 骨干网络的上下文理解能力来解决这个问题。对于传递给轻量级 Llama 语音 token 解码器(0.3 B)的每个文本 token,我们将其 LLM 骨干网络的隐藏状态(经 MLP 层重塑)与其语音解码器相加,以进一步生成 S3 token。由于韵律决策已由 LLM 骨干网络预先编码,因此小型语音解码器可以将其容量用于语音建模。此外,输入文本 token 和输出语音 token 以时间对齐的方式交错排列,以确保输出语音与并发环境上下文紧密耦合,详见3.4节。
Waveform Synthesis。流式 flow-matching 解码器根据多模态系统提示中的参考音频,将生成的 S3 语音 token 转换为音频波形。
3.Omni-Flow
在现有的交互范式中,感知和响应被限制在交替的阶段,导致如图 3 所示的 I/O 阻塞和被动响应问题。为了使模型能够同时进行感知和输出,我们提出了 Omni-Flow 框架,该框架通过共享的时间轴协调全模态的输入和输出流。受时分复用技术的启发,Omni-Flow 将连续的交互划分为持续时间为 的细粒度时间窗口。在每个窗口内,模型在生成下一个输出的同时,会整合新到达的信号,从而将传统的轮次操作转换为如图 4 所示的时间局部更新流。当 足够小时,感知和响应在时间上紧密耦合,自然地近似于全双工行为。
3.1 Time-Aligned Streams
我们在交互过程中识别出三个时间对齐的信息流:env-visual,承载对环境的实时视觉观测;env-audio,承载声学场景,包括用户语音(如有);out-stream,代表助手的文本和语音输出。在这种视角下,用户请求不再被视为一种特殊的对话角色,而是成为持续观测的世界状态的一部分,主要通过 env-audio 进入。同样,模型不再依赖于显式请求作为响应的触发条件。相反,out-stream 会随着持续的感知而演化。因此,该模型处于一个始终在线的多模态环境中,它不仅需要决定输出什么,还需要自主决定是否输出以及何时输出。
3.2 Unified Serialization
鉴于这些数据流,我们将其组织成一个统一的序列,以便传递给标准的因果语言模型。对于第 个时间块,来自 env-visual 和 env-audio 的输入分别编码为视觉 token 序列 和音频 token 序列 ,而 out-stream 中的更新则表示为输出 token 序列 。当不需要产生输出时, 仅包含一个特殊的 token。我们将这些时间对齐的 token 分组为 ,并通过将连续的分组连接成一个序列来序列化交互。在每个时间块内,模型首先处理新到达的感知 token,然后生成输出 token,从而使每个输出都基于最近的观测结果。减小时间块大小 可以提高模型刷新感知的频率,使其与不断变化的环境更加紧密地同步。由于模型会在每个时间窗口内决定是否输出,因此它自然地支持主动行为,并减少了对外部 VAD 模块的依赖。
3.3 Design Tradeoffs

Omni-Flow 引入了几个直接影响模型稳定性和响应速度的设计选择。因此,我们从三个维度进行消融实验:时间粒度、边界明确性和控制策略。时间粒度指定每个时间段的持续时间(1.0 秒、0.2 秒或 0.1 秒)。边界明确性指定连续时间段之间是否由显式的特殊 token 分隔。控制策略指定模型如何决定是否发声:在 Listen-Speak (LS) 策略中,模型首先预测一个二元 listen/speak 控制 token,然后再生成内容;在Listen-Text (LT) 策略中,模型直接在共享的输出空间中预测 或普通文本 token。结果如表 1 所示。
Temporal granularity governs the central latency-capacity tradeoff。减小数据块大小可以提高时间响应速度,但也会减少每个数据块内用于控制和生成的建模预算。当数据块过短时,模型在每个时间窗口内的信息量不足以做出稳定的决策并生成连贯的输出,从而导致性能显著下降。在我们的设置中,1.0 秒的数据块大小能够提供最佳平衡。
Boundary explicitness is consistently beneficial。明确标识组间边界能带来更好的效果。这表明区分新观测到的输入和新生成的输出并非易事,而明确这种结构可以减轻模型的负担。
Separating interaction control from content generation leads to more stable modeling。LS 的性能优于 LT,这表明决定是否说话应该与决定说什么分开,而将两者纠缠在单个预测步骤中会使全双工交互更难学习。
3.4 Time-Aligned Interleaving for Timely Speech Generation

Omni-Flow 将模型输出表示为一个与输入同步演化的流。然而,保持语音输出与最新观测到的上下文之间的时间一致性并非易事。难点在于文本生成时间和语音播放时间的不匹配:如果在 秒的时间间隔内生成的文本需要远超 秒的时间才能发出声音,语音流就会逐渐滞后于模型演化的状态。因此,在特定时刻听到的音频可能对应于更早生成的文本,导致响应在时间上相对于正在进行的交互而言显得过时。此外,每个文本 token 的发音持续时间是可变的,并且取决于上下文,这使得问题更加复杂。
现有的流式语音生成方法通常采用图 5 (a) 和 (b) 所示的两种策略之一。一些方法首先生成相对较长的文本,然后从中合成语音。另一些方法则使用固定的文本-语音 token 比例将文本和语音交错排列。虽然这两种策略都能生成高质量的语音,但它们并没有明确地将生成的语音与交互时间线对齐。前者允许文本的运行时间远远领先于播放时间,而后者则假设文本 token 和语音持续时间之间存在近乎固定的对应关系。在全双工交互中,这两种设计都可能导致模型持续输出过时且与当前环境不符的语音内容。
为了解决这个问题,我们提出了 Time-Aligned Interleaving (TAIL) 策略,这是一种分块语音生成策略,能够自适应地控制每一步生成的文本量。TAIL 并非将每个分块独立地匹配到固定的语音时长,而是考虑整个交互过程中累积的播放进度。在第 个分块处,模型会调整生成的文本量,使得在语音输出新生成的内容后,语音流能够接近当前时间边界 。如果之前的分块已经造成了轻微的播放延迟,模型可以自适应地减少当前分块中生成的文本 token 数量,以使语音能够跟上。通过这种方式,TAIL 能够使语音响应与模型的最新状态保持接近,而不是让文本远远领先于音频。
我们通过收集每个文本 token 的起始时间和结束时间,从全双工流训练数据中构建 TAIL 监督。起始时间落在 范围内的 token 及其对应的语音 token 被分配到第 个 Omni-Flow 数据块中。这种格式训练模型学习一种与历史相关的交错模式,其中每个数据块中的文本 token 数量可以根据累积的播放对齐情况而变化。
Look Ahead Speech Generation。语音生成可能仍然需要有限的未来文本上下文。例如,“the”的发音取决于后面的单词,例如“the apple”和“the car”。因此,TAIL 采用了一种有界前瞻机制:第 个文本块中最后几个文本 token 的语音 token 被延迟到第 个文本块,而其余 token 则在第 个文本块中播放。这为发音和韵律提供了局部上下文,同时又不会让文本流大幅超前于播放。因此,TAIL 在保持 Omni-Flow 时间对齐结构的同时,实现了连续且及时的语音生成。
4.Data
4.1 Speech Data
我们收集大规模自然语音数据以实现广泛的功能覆盖,并收集高质量的对话数据以实现可控的自然语音生成。
Large-scale Natural Speech Data。我们通过整合多个开源组件的流程,处理从各种来源收集的数百万小时未标注语音数据,从而生成用于零样本文本转语音(TTS)、自动语音识别(ASR)和多轮多说话人对话的训练集。这个多样化的语料库涵盖了各种不同的说话人、口音和对话模式。
Spoken Dialog Data。我们首先使用基于文本的 LLM 从各种种子 query 中生成口语化的指令遵循对话。然后,我们选择其中一部分对话,由专业配音演员在录音棚环境下重新录制。在录音过程中,配音演员采用对话式的风格,而非逐字逐句地朗读剧本,在保持声音一致性的前提下,平衡结构化的内容和即兴的表达,并灵活地调整情绪、语速和重音。最终得到的语料库涵盖了指令遵循 TTS、问答以及多轮自然对话。
4.2 Vision-Language Data
本节介绍 MiniCPM-o 4.5 的视觉语言数据。在 MiniCPM-V 4.5 数据系统的基础上,我们进一步扩展了规模并提高了质量,以涵盖更广泛的任务类型和真实场景。
High-Quality Knowledge and Alignment Data。我们更新了 CapsFusion 流程中使用的生成器模型,以合成更多信息丰富的图像解释,并通过改进图像-文本相关性估计来进一步改进我们的过滤过程。
Complex Document and OCR Data。为了更好地利用文档知识,我们扩展了 MiniCPM-V 4.5 的统一文档知识和 OCR 学习方法,并引入了一种相关性感知 mask 策略。具体来说,我们不再随机 mask 文本区域,而是优先处理与文档图像中的图形和图表更相关的区域。这促使模型更多地关注视觉内容,同时减少了仅凭文本上下文即可解决的训练案例的比例。
Real-World Scenarios Data。捕捉实际用户交互的细微差别是我们数据管理的核心重点。我们引入了更自然、更多样化的 query 模式。通过将简短直接的答案示例重写为详细的、逻辑清晰的解释,我们显著提升了模型响应的深度和可读性。此外,我们还应用了基于奖赏模型的过滤流程,以确保整体数据质量并使其与人类偏好保持一致。
Dense Video Perception Data。为了增强模型的视频感知和跨帧推理能力,我们构建了一个密集的视频解释数据集,该数据集提供了对时间事件、人类行为和复杂场景转换的连续、细粒度的描述。
Text-only Data。我们还加入了来自 MiniCPM 4.1 后训练数据集的高质量纯文本指令数据,以保持强大的语言能力。
4.3 Omni-Modal Full-Duplex Data
我们的全模态全双工数据集包含大规模网络数据和少量高质量指令样本。每个训练样本都包含完整的视觉输入、音频输入、输出文本和输出语音,其中每条信息都带有时间索引。
Large-scale Web Audio-video Data。我们收集了大量的网络音视频数据,以全面覆盖真实世界的全双工场景。我们过滤掉了以单人语音为主或音视频相关性较弱的片段。为了进一步提升质量,我们应用了基于 OCR 的字幕去除、说话人检测以及对 ASR 生成的转录文本进行过滤,从而减少了误导性的捷径以及信息量低或噪声较大的片段。
Full-Duplex Task Data。为了支持需要更精确交互的目标全双工功能,我们手动构建了多个场景并标注了相应的指令遵循数据。基于这些高质量的任务样本,MiniCPM-o 4.5 支持连续场景描述和主动提醒等高级功能。
5.Training
本节介绍 MiniCPM-o 4.5 的整体训练流程。提升全模态能力的关键挑战之一在于,如何在保持各模态固有优势的同时,实现高效、无缝的跨模态泛化。为此,我们精心设计了一个分阶段的流程,以平滑稳定的方式将语音逐步集成到多模态系统中。该流程基于 MiniCPM-V 4.5 的预训练节点。首先进行语音预训练,以建立基础的音频理解和语音生成能力。然后进行联合预训练,构建统一的跨模态表征。接下来,我们采用监督式微调,以实现自然流畅的指令跟踪以及跨文本、语音、图像和视频的高质量交互。最后,我们应用强化学习来进一步提升推理能力并减少幻觉。
5.1 Speech Pretraining
MiniCPM-o 4.5 使用预训练的 Whisper 编码器和 MiniCPM-V 4.5 的预训练检查点进行初始化,并随机初始化语音相关模块,包括音频投影器、LLM 到语音投影器和语音解码器。为了保持骨干网络的视觉和语言能力,我们冻结预训练组件,仅更新新添加的模块。此阶段将 Whisper 特征与 LLM 隐藏空间对齐,并训练语音解码器,使其能够将 LLM 骨干网络的隐藏状态转换为语义和韵律上相关的语音 token。
5.2 Joint Pretraining
在第二阶段,我们解冻所有参数,并对视觉-语言、语音和全模态数据的均衡混合模型进行联合预训练。为了稳定优化过程,我们将不同的模态组合分配到不同的数据并行排序中,从而确保每个训练步骤的数据比例固定。除了传统的基于轮次的样本外,该混合模型还包含主动式和全双工交互数据,其中文本 token 与语音和视觉信号在同一时间轴上对齐。该模型采用统一的下一 token 预测目标进行训练,在保持其基础视觉理解能力的同时,获得了实时全模态交互能力。
5.3 Joint Supervised Fine-Tuning
联合有监督微调阶段激活了全模态能力并增强了指令遵循能力。它包含两个阶段:首先进行大规模指令微调,以实现广泛的能力适应;然后进行高质量的人工标注微调,以实现精细的行为改进。为了在推理过程中灵活地权衡质量和效率,我们使用不同分辨率和帧速率的全模态数据进行扩充,随机将最大帧分辨率设置为 0.2–0.4 兆像素,并将帧速率均匀地采样在 1–5 FPS 之间。
5.4 Reinforcement Learning
我们进一步通过强化学习改进 MiniCPM-o 4.5。我们首先应用 GRPO 来增强推理和指令遵循能力,使用答案准确率以及格式奖励等辅助奖励。对于准确率奖励,我们将基于规则的验证与一个高效的评判模型相结合,以提高正确回答的召回率。
为了提升 token 效率,我们引入了一种改编自 Kimi-K1.5 的平滑长度奖励:
这里, 是正确性指示变量, 是在同一提示词的多个响应上计算得到的。 项避免奖励较短但错误的回答,而 会在长度差异较小时降低奖励幅度。我们还加入了一个通用奖励模型,以提升回答质量并抑制非预期的代码混杂。为了提高收敛效率,我们在前 480 个训练步骤中不加入长度奖励。
最后,我们应用 RLAIF-V 来减少视觉场景中的幻觉。我们发现,从图文数据中学到的幻觉缓解能力可以有效迁移到全模态全双工交互中,也能够减少流式设置下的幻觉。