首页站长新闻黑森林实验室发布Flux3:首个原生生成音频的多模态基础模型 实现20秒音画同步生成

黑森林实验室发布Flux3:首个原生生成音频的多模态基础模型 实现20秒音画同步生成

2026-07-24 360

德国人工智能公司 Black Forest Labs(黑森林实验室)正式发布新一代多模态基础模型 Flux3。该模型基于 Self-Flow 架构打造,融合图像、视频、音频以及动作编解码能力,试图实现对物理世界与数字环境的统一理解与生成。

相比传统图像生成或视频生成模型,Flux3最大的特点在于其原生多模态能力。

Flux3支持原生音频生成,实现音画同步输出

Flux3被称为首个支持原生音频生成的多模态基础模型,可以一次性生成最长 20秒音视频同步内容

目前,该模型支持多种生成方式,包括:

  • 文本生成视频
  • 图像生成视频
  • 视频到视频转换
  • 基于关键帧的视频转场
  • 多角色对话生成

通过将视觉、声音和动作能力整合到同一个模型架构中,Flux3不再局限于单一的视频或图像生成任务,而是尝试建立更加完整的多模态世界理解能力。

这意味着AI生成内容正在从“看得见”进一步发展到“听得见、动起来”。

测试表现:Flux3在视频生成评测中展现竞争力

根据黑森林实验室公布的早期测试数据,在 720p分辨率、10秒视频片段测试环境下,Flux3在多项对比评测中表现突出。

测试结果显示:

  • 相比 Luma AI Ray3.2,Flux3获得约 93%的胜率
  • 相比 Runway Gen-4.5,Flux3取得约 77%的胜率

此外,在面对 ByteDance Seedance 2.0、Google Gemini Omni Flash 等先进模型时,Flux3也保持了一定竞争优势。

不过需要注意的是,这些数据主要来自官方测试环境,实际生成效果仍需要等待更多公开测试和用户反馈验证。

Flux3进一步拓展机器人应用,多模态能力进入现实场景

除了内容生成领域,黑森林实验室还将Flux3能力拓展至机器人应用。

该公司与机器人企业 Mimic Robotics 联合开发了面向机器人任务的动作模型 Flux-mimic

目前,Flux-mimic已经进入实际工业场景测试,并在 Audi 工厂开展生产任务验证。

这一方向意味着,多模态模型的发展目标正在从生成数字内容,进一步延伸到理解现实环境并执行物理任务。

Flux3将分阶段开放,开发者版本即将推出

黑森林实验室表示,Flux3将采用分阶段发布策略。

目前:

  • Flux3Video 已率先上线
  • Flux3Image 将于近期推出
  • 支持开源权重的 Flux3Dev版本 也将在后续开放

通过逐步开放不同能力模块,BFL希望让开发者和企业能够探索Flux3在视频生成、智能交互、机器人控制等更多场景中的应用。

多模态AI竞争进入新阶段

过去几年,AI生成领域主要围绕文本生成图片、图片生成视频展开。

而随着Flux3、Gemini等多模态模型的发展,行业竞争正在从单纯提升生成质量,转向对现实世界的综合理解能力。

未来的AI模型不仅需要生成画面,还需要理解声音、动作、环境以及人与物之间的关系。

Flux3的发布,代表着多模态基础模型向“视觉+听觉+行动”统一方向迈出了重要一步,也进一步推动AI从内容生成工具向智能交互系统演进。

  • 广告合作

  • QQ群号:4114653

温馨提示:
1、本网站发布的内容(图片、视频和文字)以原创、转载和分享网络内容为主,如果涉及侵权请尽快告知,我们将会在第一时间删除。邮箱:2942802716#qq.com(#改为@)。 2、本站原创内容未经允许不得转裁,转载请注明出处“站长百科”和原文地址。

相关文章