阿里巴巴近日发布Qwen3.8-Omni-Flash多模态大模型,支持文本、图像、音频和视频输入,最长上下文窗口达到100万Token,面向长文档处理、长时间音视频分析和复杂多模态任务进行了优化。
Qwen3.8-Omni-Flash可以处理大篇幅资料和较长时间的音视频内容,并支持从视频中提取关键信息、跨片段进行分析和推理。它还可以用于会议内容整理、后续任务辅助以及视频研究报告生成。
在音视频场景中,模型支持生成可控描述、从长时间录音中提取证据,并结合视频不同片段完成内容分析。与上一代模型相比,Qwen3.8-Omni-Flash在OmniVideoBench上的得分从63.4提升至67.8,Token消耗则从145,736减少到79,117,下降约45.7%。
成本方面,阿里巴巴表示,该模型的音频输入价格降低了98%,音频和视觉输入成本整体下降超过93%。在部分长上下文任务中,Qwen3.8-Omni-Flash的表现接近Gemini 3.8 Flash,但具体结果会受到推理模式和任务类型影响。
目前,用户可以通过Qwen Chat在网页端和移动端体验Qwen3.8-Omni-Flash。开发者则可以通过DashScope调用该模型,并使用兼容OpenAI接口的客户端库将其集成到现有应用中。
对于需要处理长文档、录音、视频会议和多模态资料的开发者来说,百万Token上下文可以减少拆分文件和重复提交内容的需要。结合更低的音视频输入成本,该模型也更适合用于会议分析、视频检索、内容审核和长素材研究等应用。
访问阿里云官网>>>
相关阅读:《阿里云Token Plan个人版升级:加量不加价 新增12类Agent Harness工具》
-
广告合作
-
QQ群号:4114653



