note

一、Qwen3.8-Omni-Flash

1、向 Qwen3.8-Omni-Flash 提出了一项任务:在 12 小时内提升 Qwen2.5-Omni-3B 的四川话识别能力,并交付可用模型。它自主选定 WenetSpeech-Chuan 评测集、固定评测标准并完成基线测试,随后直接听取语音样本,结合识别结果诊断问题,构建针对性的训练数据。在连续 4 轮实验中,Agent 累计构建了 3,413 条训练数据,并根据评测反馈调整方案、保留有效改进、回退无效尝试。最终,Qwen2.5-Omni-3B 在同一评测集上的字符错误率从 25.79% 降至 15.30%,相对下降约 40.7%。
在这里插入图片描述

2、扩展了 Qwen-MM-Plugins,为长音视频的按需感知、工具调用与工作流执行提供支持;同时开源 Qwen-Live Harness,为实时、持续的全模态交互提供原生运行环境。两者分别面向长程工作流与实时交互,并在与模型的共同迭代中持续拓展全模态 Agent 的能力边界
Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
Qwen-Live Harness(Coming Soon): https://github.com/QwenLM/Qwen-Live-Harness

(1)通用类
core:读本地图片/视频帧,把文档、代码、3D 模型、NIfTI 医学体数据可视化给模型看。默认原生模式不用 API key。(最推荐装)
api:调云端模型服务做图/视频/音频理解——VL 视觉问答/OCR/定位、Omni 转写/说话人分离/字幕、ASR、SAM3 分割。走 DashScope 或自建兼容服务。
search:联网搜索 + 网页抽取 + 反向图搜(Serper/Exa/Tavily 等)。
(2)Qwen VL 系列专用
video-memory(长视频分层记忆,问答不用重看)、video-edit(图/视频/音频生成与剪辑)、blender(驱动 Blender 建模渲染)、freecad(参数化 CAD)、edu-agent(生成中文数理讲解视频)。
(3)Qwen Omni 系列专用
omni-chatcut(音乐 MV / 影视解说 / 保留音色的视频翻译)、omni-video2note(教程视频转带插图 PDF 笔记)、omni-skill-creator(把演示视频变成可复用的 Agent Skill)、omni-memory(长视频的"音+画"记忆:谁在场、谁说了什么、怎么说的)。

3、Qwen3.8-Omni-Flash 原生 Agent 则从问题出发,自主决定该看什么、听什么,并通过由粗到细的多轮取证定位关键信息
4、通过扩展数据、上下文与 Agentic Environment,Qwen3.8-Omni-Flash 的音视频能力接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。

二、 Qwen-MM-Plugins

扩展了 Qwen-MM-Plugins,为长音视频的按需感知、工具调用与工作流执行提供支持;同时开源 Qwen-Live Harness,为实时、持续的全模态交互提供原生运行环境。两者分别面向长程工作流与实时交互,并在与模型的共同迭代中持续拓展全模态 Agent 的能力边界
Qwen-MM-Plugins: https://github.com/QwenLM/Qwen-MM-Plugins
Qwen-Live Harness(Coming Soon): https://github.com/QwenLM/Qwen-Live-Harness

omni tool:

perceive_media
omni_asr
omni_asr_timestamped
omni_multi_speaker_asr
omni_av_caption
omni_av_grounding
omni_av_counting
omni_music_caption

transcribe_audio   # Qwen3-ASR
segmentation       # SAM3
vision_chat
ocr
grounding

专门处理长视频的音视频联合记忆omni-memory:
链路举例:

< ~10 min
    ↓
watch_and_answer
    ↓
Omni 一次看完整视频

10~30 min
    ↓
视情况建立 memory

> ~30 min
    ↓
build audio-visual memory
    ↓
retrieval
    ↓
answer

omni-memory对应的工具:

get_memory_status
get_memory_overview
plan_and_search
watch_and_answer
replay_and_answer

get_people
get_person_dialogue

search_dialogue
search_facts
search_memory

get_timeline
get_moment

总结下:
在这里插入图片描述

Reference

[1] Qwen3.8-Omni-Flash:从理解到交付,释放全模态Agent生产力

Logo

火山引擎视频云技术社区,是面向 AI 音视频开发者的技术交流平台。这里汇聚源自抖音、豆包等亿级 DAU 产品的 RTC、直播、点播、AI 媒体处理、音视频互动技术,提供接入指南、最佳实践、性能调优、场景案例、Demo 代码、开源项目、白皮书和 API 文档。社区汇聚官方工程师与一线开发者,为 AI 视频通话、数字人、AI 视频处理等应用的开发与落地提供技术支持。

更多推荐