阿里发布Qwen3.8-Omni-Flash:全模态模型与接入指南
阿里发布Qwen3.8-Omni-Flash全模态模型,支持音视频Agent与实时流式交互。本文解析其核心能力、成本优化与开发者接入要点。

2026 年 9 月 18 日,阿里云通义千问对外推出 Qwen3.8‑Omni‑Flash 原生云端全模态模型,同步推出面向流式交互的 Qwen3.8‑Omni‑Flash‑Realtime 实时版本,并且配套发布 Qwen‑MM‑Plugins 插件库、开源 Qwen‑Live Harness 交互运行时。该模型最大上下文窗口达到 100 万 token,原生同时接纳文本、图片、音频、视频输入,产品重心不再局限于多媒体内容的描述识别,而是面向 Agentic(智能体驱动)音视频任务,结合工具调用完成取证、流程推进、结果输出,同时大幅下调音视频类 API 调用成本,给会议处理、巡检视频分析、音视频智能体等业务带来新的选型方案。
不少多模态模型还停留在 “输入素材,返回摘要描述” 的阶段,而 Qwen3.8‑Omni‑Flash 把能力延伸到任务执行链路:围绕用户目标自主定位音视频关键片段、抽取证据、调用外部工具完成后续业务动作。本文基于官方公开评测文档、公开媒体报道,梳理模型核心评测指标、关键特性、配套开源组件、调用方式,同时从工程落地角度给出选型与风险提示,方便开发者客观评估业务适配度。
一、基础规格与官方评测基准
该模型仅对外提供云端 API 服务,不开放本地权重下载。官方说明:在维持同尺寸模型文本能力水平的前提下,重点强化音视频相关能力;在累计近 30 项评测集合上,对比前代 Qwen3.5‑Omni‑Plus 平均得分提升超过 26%。下面整理核心基准以及指标含义:
表格
| 评测基准 | 测试方向 | 相对上代 Qwen3.5‑Omni‑Plus 变化 |
|---|---|---|
| WildClawBench‑MM | 音视频 Agent 长程复杂任务 | 提升 36.5 分 |
| AgenticVBench | Agent 主动取证、工具调用能力 | 提升 22.3 分 |
| UniClawBench | 多模态 Agent 综合能力 | 取得 69.6 分 |
| LongAudioSpan | 长音频内容理解能力 | 提升 8.3 分 |
| OmniVideoBench | 长视频 Agent 理解 | 得分由 63.4 提升至 67.8,Token 消耗下降 45.7% |
| OmniCap‑IF(CSR / ISR) | 可控视频描述指令遵循 | 分别提升 8.5 / 14.1 分 |
| AliMeeting 数据集 | 中文多人会议说话人分离 + 带归属字错率 | DER 说话人分离错误率 88.11→3.35;cpWER 带说话人归属字错率 89.61→17.18 |
AliMeeting 数据集的结果具备很高工程参考价值。DER 代表说话人分离错误率,cpWER 是计入发言人归属信息的字错误率。前代模型在多人会议场景基本无法使用,很难区分哪一句发言属于哪个人;新版本将说话人切分能力拉到可用区间,会议转录结果可以绑定发言人身份,不再大量出现 “某人提出” 这种模糊表述。
OmniVideoBench 的数据值得仔细看待:分数提升幅度不算爆炸,但处理同等视频任务 token 消耗量从 145736 下降至 79117,降幅约 45.7%。这来自模型内置的按需感知策略:不会对全部视频帧做无差别精细编码,而是结合问题定位关键片段,只对目标时间窗口做深度解析,直接降低推理开销,对大批量长视频业务有现实意义。
官方横向对比测试显示,该模型综合音视频能力接近 Gemini3.8 Flash,音频单项能力表现更占优势;静态模式与 Agent 工具模式下,不同评测集互有胜负。全部评测结果来自厂商自测,正式上线前务必拿自身业务真实素材复测,不可直接将宣传跑分当作生产环境保障。
二、核心业务能力拆解
1. 多人会议长音视频一体化处理
模型支持最长一小时音视频输入,一站式完成说话人区分、转录、身份绑定、生成带时间戳的会议纪要,自动识别待办事项,评估项目风险。配合 Function‑Calling 工具调用,输出结构化结果之后还可以直接触发发送邮件、创建任务工单等后续业务动作。
传统企业会议处理一般是 ASR 语音识别、独立说话人分离、大模型摘要三段式拼接,多模块流转会丢失发言人身份上下文,摘要经常丢失主体信息。Qwen3.8‑Omni‑Flash 将音视频解析、说话人归属、结构化摘要放在同一轮推理内完成,完整保留身份关联,输出结果可以直接写明 “XX 提出 XX 诉求”,减少大量人工二次整理的成本。
2. Agentic 主动取证与可控多媒体生成
支持可控音视频 Caption,开发者可以明确指定描述对象、时间区间、信息粒度、输出格式,不再只能拿到笼统的全篇摘要。面对长视频素材,模型围绕提问自主检索素材片段、抽取关键证据再整理答案。
典型落地场景包括短剧翻译(角色识别、口语化翻译、配音、成片质检)、长电影内容研究报告、产线巡检视频分析。官方还公布一组受控内部实验:模型在 12 小时闭环流程内,自主完成评测集挑选、训练数据构建,4 轮迭代产出 3413 条样本,将 Qwen2.5‑Omni‑3B 四川话识别字符错误率由 25.79% 下降至 15.30%,相对降幅约 40.7%。需要注意,该结果属于受控演示,不代表所有语种、业务领域都可以复现同等优化效果。
3. Realtime 实时流式版本:空间音频 “听声辨位”
配套发布 Qwen3.8‑Omni‑Flash‑Realtime 实时接口,依托 WebSocket 双向流,边接收音视频流边输出响应,同时支持实时工具调用。官方称其为首个实现 “听声辨位” 的商用全模态 API,可以融合空间音频信号 + 视觉画面,判断声源方向与距离;同时支持通过 Skill 注入人设、业务知识库、交互规则,适合实时口语陪练这类需要长期会话人设的业务场景。
4. 配套开源工具生态
本次一并放出两套开源组件,降低开发者搭建音视频 Agent 的开发成本:
Qwen‑MM‑Plugins 插件库:内置 Video2Note、Omni Skill Creator 等能力。Video2Note 可以将数小时视频生成图文位置对齐的 PDF 笔记;Omni Skill Creator 能够从人工操作演示视频提炼业务流程,输出可复用 Agent 技能定义。插件可以对接多款主流 Agent 运行时,给原有 Agent 体系补充多媒体处理能力。
Qwen‑Live Harness:面向持续流式全模态交互的开源运行时,专门适配 Realtime 版本 API,封装会话管理、任务委派、长期记忆等逻辑,简化实时音视频业务开发。
> 提示:插件与运行时属于上层开发工具,实际推理能力依旧依赖云端 Qwen3.8‑Omni‑Flash API,插件本身不携带模型权重。
三、计费口径与成本注意事项
官方对外公布对比上代产品:每小时音频输入价格降幅超 98%,音视频混合输入每小时降幅超 93%,图文音视频混合输入约 0.8 元 / 百万 token。这里有几个容易混淆的口径,做预算测算时需要区分清楚:
- 降幅是对比该产品自身前代版本,并非横向对比其他厂商模型;
- 0.8 元 / 百万 token 是图文音视频混合输入口径,纯文本、纯音频、实时流分别拥有独立计价规则,不能直接套用混合价格;
- 长内容支持缓存机制,缓存命中之后单价会大幅降低,大批量重复素材业务,实际账单会进一步下降。
建议正式做成本测算,拿自己真实业务样本,在百炼平台跑若干次,统计实际 token 消耗,再做预算,不要直接照搬宣传口径。
四、开发者接入、代码示例与网关选型
Qwen3.8‑Omni‑Flash 兼容 OpenAI 调用协议,开发者可以复用 OpenAI SDK 完成调用,不需要完全重写业务逻辑。
from openai import OpenAI
client = OpenAI(
api_key="你的DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
resp = client.chat.completions.create(
model="qwen3.8‑omni‑flash",
messages=[
{
"role": "user",
"content": [
{"type": "video_url", "video_url": {"url": "你的视频资源地址"}},
{"type": "text", "text":"输出带时间戳的会议待办清单,标明对应发言人"}
]
}
]
)
print(resp.choices[0].message.content)业务提示:全模态模型输出质量高度依赖提示词约束,尽量把格式、字段、粒度要求写进 prompt,不要全部依赖后处理规则清洗结果。
如果业务同时需要对接多款国产大模型,需要维护多套密钥与不同接口规范,可以借助统一 API 网关降低适配成本。koalaapi 就提供 OpenAI 兼容风格的统一接入层,但开发者务必自行核对上游模型版本、计费规则,网关本身不改变底层模型推理能力。
业务边界与踩坑提示
- 模型只支持云端调用,私有化本地部署暂不可用;
- Realtime 版本是流式长连接,业务务必实现断线重连、会话状态恢复;
- 音视频资源存在单文件时长、大小上限,普通版本视频上限 2 小时,音频上限 3 小时,业务不能无限制传入超长素材;
- 官方评测均为自测,第三方复现数据尚未充分,上线前务必使用真实业务数据做压测。
五、业务选型建议:什么场景适合迁移
优先考虑接入 Qwen3.8‑Omni‑Flash
- 大量处理会议录音、访谈音频,需要说话人区分、纪要、待办提取;
- 长视频分析场景:产线巡检视频、课程录像、短剧素材,需要抽取结构化信息;
- 想要构建音视频 Agent,希望模型可以自主定位素材片段,完成证据检索;
- 业务可以接受云端 API 调用,不需要本地私有化部署。
不建议盲目迁移
- 业务以纯文本推理为主,现有文本模型已经满足需求:该模型文本能力仅 “保持同尺寸水平”,不会带来文本任务的显著收益,反而增加多模态调用开销;
- 必须本地离线推理:暂无权重包;
- 极高风险场景(法律取证、司法鉴定),模型输出不能直接作为证据,必须搭配人工复核。
六、总结
Qwen3.8‑Omni‑Flash 带来的最大变化,是把音视频 Agent “按需感知取证” 的思路落地为商用云端 API。能力不再局限于给音视频做摘要描述,而是面向 “解析素材之后执行后续业务动作”,同时通过大幅度降价,把大批量音视频解析的成本门槛往下拉。
开发者要理性看待宣传指标:评测分数、降价幅度都是厂商自测口径,实际效果取决于素材质量、提示词设计、业务场景。迁移前优先拿一小部分真实业务样本做对照实验,评估准确率、token 消耗、错误模式之后,再全量切换业务链路。
了解更多:https://koalaapi.com

