黑森林实验室发布Flux3 多模态模型 首次支持 20 秒原生音视频同步生成
·

作为首款支持原生音频生成的模型,Flux3可 一次性输出长达20秒的音视频 同步片段,并涵盖文本/图像/视频转视频、基于关键帧的转场及多语言对话等功能。在720p分辨率、10秒片段的早期测试中,Flux3展现出强劲竞争力,性能超越Luma Ray3.2(93%胜率)与Runway Gen-4.5(77%胜率),并在与Seedance2.0及Gemini Omni Flash等顶尖模型的对标中保持微弱优势。
此外,公司联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试。BFL采取分阶段推出策略,Flux3Video现已上线,Flux3Image与开源权重的“Flux3Dev”也将在近期陆续发布。通过打破单一模态的信息局限,Flux3正加速推动AI向具备感知与行动能力的物理世界“世界模型”演进。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)