星知

logo
logo
登录

黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒音视频,胜率碾压Grok与Seedance

Black Forest Labs发布FLUX3多模态基础模型,首次实现20秒音视频同步原生生成,性能领先多个主流模型,并探索与Mimic Robotics合作拓展机器人行为预测领域。
发布时间:2026/07/25 03:20|分类:机器人
Black Forest Labs宣布以Early Access方式上线多模态基础模型FLUX3,采用统一架构联合学习图像、视频和音频。该模型基于Self-Flow学习框架扩展,在FLUX.1和FLUX.2系列基础上进一步拓展。FLUX3可在单次生成中输出最长20秒的视频并附带原生音频,支持文生视频、图生视频、视频生视频、关键帧转视频、多镜头串联等多种创作模式。在带声音的10秒720p视频人工评测中,FLUX3对比Grok Imagine Video胜率达69%,对比Seedance 2.0和Gemini Omni Flash胜率均为52%。图像方面,FLUX3可完成生成与编辑,覆盖多种风格。更值得关注的是,Black Forest Labs正与Mimic Robotics合作,研究将FLUX3用作机器人行为预测模型,将多模态AI能力从内容生成延伸到实体机器人领域。
机器人星知