教程2026年9月20日8,324 浏览约 8 分钟阅读

阿里发布Qwen3.8-Omni-Flash:全模态模型与接入指南

阿里发布Qwen3.8-Omni-Flash全模态模型,支持音视频Agent与实时流式交互。本文解析其核心能力、成本优化与开发者接入要点。

阿里发布Qwen3.8-Omni-Flash:全模态模型与接入指南

2026 年 9 月 18 日,阿里云通义千问对外推出 Qwen3.8‑Omni‑Flash 原生云端全模态模型,同步推出面向流式交互的 Qwen3.8‑Omni‑Flash‑Realtime 实时版本,并且配套发布 Qwen‑MM‑Plugins 插件库、开源 Qwen‑Live Harness 交互运行时。该模型最大上下文窗口达到 100 万 token,原生同时接纳文本、图片、音频、视频输入,产品重心不再局限于多媒体内容的描述识别,而是面向 Agentic(智能体驱动)音视频任务,结合工具调用完成取证、流程推进、结果输出,同时大幅下调音视频类 API 调用成本,给会议处理、巡检视频分析、音视频智能体等业务带来新的选型方案。

不少多模态模型还停留在 “输入素材,返回摘要描述” 的阶段,而 Qwen3.8‑Omni‑Flash 把能力延伸到任务执行链路:围绕用户目标自主定位音视频关键片段、抽取证据、调用外部工具完成后续业务动作。本文基于官方公开评测文档、公开媒体报道,梳理模型核心评测指标、关键特性、配套开源组件、调用方式,同时从工程落地角度给出选型与风险提示,方便开发者客观评估业务适配度。

一、基础规格与官方评测基准

该模型仅对外提供云端 API 服务,不开放本地权重下载。官方说明:在维持同尺寸模型文本能力水平的前提下,重点强化音视频相关能力;在累计近 30 项评测集合上,对比前代 Qwen3.5‑Omni‑Plus 平均得分提升超过 26%。下面整理核心基准以及指标含义:

表格

评测基准测试方向相对上代 Qwen3.5‑Omni‑Plus 变化
WildClawBench‑MM音视频 Agent 长程复杂任务提升 36.5 分
AgenticVBenchAgent 主动取证、工具调用能力提升 22.3 分
UniClawBench多模态 Agent 综合能力取得 69.6 分
LongAudioSpan长音频内容理解能力提升 8.3 分
OmniVideoBench长视频 Agent 理解得分由 63.4 提升至 67.8,Token 消耗下降 45.7%
OmniCap‑IF(CSR / ISR)可控视频描述指令遵循分别提升 8.5 / 14.1 分
AliMeeting 数据集中文多人会议说话人分离 + 带归属字错率DER 说话人分离错误率 88.11→3.35;cpWER 带说话人归属字错率 89.61→17.18

AliMeeting 数据集的结果具备很高工程参考价值。DER 代表说话人分离错误率,cpWER 是计入发言人归属信息的字错误率。前代模型在多人会议场景基本无法使用,很难区分哪一句发言属于哪个人;新版本将说话人切分能力拉到可用区间,会议转录结果可以绑定发言人身份,不再大量出现 “某人提出” 这种模糊表述。

OmniVideoBench 的数据值得仔细看待:分数提升幅度不算爆炸,但处理同等视频任务 token 消耗量从 145736 下降至 79117,降幅约 45.7%。这来自模型内置的按需感知策略:不会对全部视频帧做无差别精细编码,而是结合问题定位关键片段,只对目标时间窗口做深度解析,直接降低推理开销,对大批量长视频业务有现实意义。

官方横向对比测试显示,该模型综合音视频能力接近 Gemini3.8 Flash,音频单项能力表现更占优势;静态模式与 Agent 工具模式下,不同评测集互有胜负。全部评测结果来自厂商自测,正式上线前务必拿自身业务真实素材复测,不可直接将宣传跑分当作生产环境保障。

二、核心业务能力拆解

1. 多人会议长音视频一体化处理

模型支持最长一小时音视频输入,一站式完成说话人区分、转录、身份绑定、生成带时间戳的会议纪要,自动识别待办事项,评估项目风险。配合 Function‑Calling 工具调用,输出结构化结果之后还可以直接触发发送邮件、创建任务工单等后续业务动作。

传统企业会议处理一般是 ASR 语音识别、独立说话人分离、大模型摘要三段式拼接,多模块流转会丢失发言人身份上下文,摘要经常丢失主体信息。Qwen3.8‑Omni‑Flash 将音视频解析、说话人归属、结构化摘要放在同一轮推理内完成,完整保留身份关联,输出结果可以直接写明 “XX 提出 XX 诉求”,减少大量人工二次整理的成本。

2. Agentic 主动取证与可控多媒体生成

支持可控音视频 Caption,开发者可以明确指定描述对象、时间区间、信息粒度、输出格式,不再只能拿到笼统的全篇摘要。面对长视频素材,模型围绕提问自主检索素材片段、抽取关键证据再整理答案。

典型落地场景包括短剧翻译(角色识别、口语化翻译、配音、成片质检)、长电影内容研究报告、产线巡检视频分析。官方还公布一组受控内部实验:模型在 12 小时闭环流程内,自主完成评测集挑选、训练数据构建,4 轮迭代产出 3413 条样本,将 Qwen2.5‑Omni‑3B 四川话识别字符错误率由 25.79% 下降至 15.30%,相对降幅约 40.7%。需要注意,该结果属于受控演示,不代表所有语种、业务领域都可以复现同等优化效果。

3. Realtime 实时流式版本:空间音频 “听声辨位”

配套发布 Qwen3.8‑Omni‑Flash‑Realtime 实时接口,依托 WebSocket 双向流,边接收音视频流边输出响应,同时支持实时工具调用。官方称其为首个实现 “听声辨位” 的商用全模态 API,可以融合空间音频信号 + 视觉画面,判断声源方向与距离;同时支持通过 Skill 注入人设、业务知识库、交互规则,适合实时口语陪练这类需要长期会话人设的业务场景。

4. 配套开源工具生态

本次一并放出两套开源组件,降低开发者搭建音视频 Agent 的开发成本:
Qwen‑MM‑Plugins 插件库:内置 Video2Note、Omni Skill Creator 等能力。Video2Note 可以将数小时视频生成图文位置对齐的 PDF 笔记;Omni Skill Creator 能够从人工操作演示视频提炼业务流程,输出可复用 Agent 技能定义。插件可以对接多款主流 Agent 运行时,给原有 Agent 体系补充多媒体处理能力。

Qwen‑Live Harness:面向持续流式全模态交互的开源运行时,专门适配 Realtime 版本 API,封装会话管理、任务委派、长期记忆等逻辑,简化实时音视频业务开发。

> 提示:插件与运行时属于上层开发工具,实际推理能力依旧依赖云端 Qwen3.8‑Omni‑Flash API,插件本身不携带模型权重。

三、计费口径与成本注意事项

官方对外公布对比上代产品:每小时音频输入价格降幅超 98%,音视频混合输入每小时降幅超 93%,图文音视频混合输入约 0.8 元 / 百万 token。这里有几个容易混淆的口径,做预算测算时需要区分清楚:

  1. 降幅是对比该产品自身前代版本,并非横向对比其他厂商模型;
  2. 0.8 元 / 百万 token 是图文音视频混合输入口径,纯文本、纯音频、实时流分别拥有独立计价规则,不能直接套用混合价格;
  3. 长内容支持缓存机制,缓存命中之后单价会大幅降低,大批量重复素材业务,实际账单会进一步下降。

建议正式做成本测算,拿自己真实业务样本,在百炼平台跑若干次,统计实际 token 消耗,再做预算,不要直接照搬宣传口径。

四、开发者接入、代码示例与网关选型

Qwen3.8‑Omni‑Flash 兼容 OpenAI 调用协议,开发者可以复用 OpenAI SDK 完成调用,不需要完全重写业务逻辑。

from openai import OpenAI

client = OpenAI(
    api_key="你的DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

resp = client.chat.completions.create(
    model="qwen3.8‑omni‑flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "video_url", "video_url": {"url": "你的视频资源地址"}},
                {"type": "text", "text":"输出带时间戳的会议待办清单,标明对应发言人"}
            ]
        }
    ]
)
print(resp.choices[0].message.content)

业务提示:全模态模型输出质量高度依赖提示词约束,尽量把格式、字段、粒度要求写进 prompt,不要全部依赖后处理规则清洗结果。

如果业务同时需要对接多款国产大模型,需要维护多套密钥与不同接口规范,可以借助统一 API 网关降低适配成本。koalaapi 就提供 OpenAI 兼容风格的统一接入层,但开发者务必自行核对上游模型版本、计费规则,网关本身不改变底层模型推理能力。

业务边界与踩坑提示

  • 模型只支持云端调用,私有化本地部署暂不可用;
  • Realtime 版本是流式长连接,业务务必实现断线重连、会话状态恢复;
  • 音视频资源存在单文件时长、大小上限,普通版本视频上限 2 小时,音频上限 3 小时,业务不能无限制传入超长素材;
  • 官方评测均为自测,第三方复现数据尚未充分,上线前务必使用真实业务数据做压测。

五、业务选型建议:什么场景适合迁移

优先考虑接入 Qwen3.8‑Omni‑Flash

  1. 大量处理会议录音、访谈音频,需要说话人区分、纪要、待办提取;
  2. 长视频分析场景:产线巡检视频、课程录像、短剧素材,需要抽取结构化信息;
  3. 想要构建音视频 Agent,希望模型可以自主定位素材片段,完成证据检索;
  4. 业务可以接受云端 API 调用,不需要本地私有化部署。

不建议盲目迁移

  1. 业务以纯文本推理为主,现有文本模型已经满足需求:该模型文本能力仅 “保持同尺寸水平”,不会带来文本任务的显著收益,反而增加多模态调用开销;
  2. 必须本地离线推理:暂无权重包;
  3. 极高风险场景(法律取证、司法鉴定),模型输出不能直接作为证据,必须搭配人工复核。

六、总结

Qwen3.8‑Omni‑Flash 带来的最大变化,是把音视频 Agent “按需感知取证” 的思路落地为商用云端 API。能力不再局限于给音视频做摘要描述,而是面向 “解析素材之后执行后续业务动作”,同时通过大幅度降价,把大批量音视频解析的成本门槛往下拉。

开发者要理性看待宣传指标:评测分数、降价幅度都是厂商自测口径,实际效果取决于素材质量、提示词设计、业务场景。迁移前优先拿一小部分真实业务样本做对照实验,评估准确率、token 消耗、错误模式之后,再全量切换业务链路。

了解更多:https://koalaapi.com

标签QwenQwen3.8-Omni-Flash全模态音视频技术解析接入指南koalaapi
Koala API · 一站式大模型 API 中转

把博客读到的,落地到你的下一个项目

国内直连 · 兼容 OpenAI SDK · GPT / Claude / Gemini 等主流模型聚合

延伸阅读

免费注册