更多文章

AI 与开发者相关深度内容

FLUX 3 Early Access 解读:20 秒原生音视频、早期评测与开放状态

Last checked: 2026-07-27.

现在能用到什么程度

FLUX 3 在 2026 年 7 月 23 日公布,当前开放的是 FLUX 3 Video Early Access,不是面向所有人的正式 GA。它最醒目的能力是一次生成最长 20 秒、带原生音频的视频,并支持文生视频、图生视频、视频转视频、视频与音频续写、关键帧生视频。未来的开放权重版本 FLUX 3 Dev 已被列入计划,但现在还不能把它写成可下载模型。

现在能测试什么 官方公布的范围 团队先确认什么
最长输出 最长 20 秒、带原生音频 实际账号的时长、分辨率和调用限制
输入方式 文本、图像、视频,以及视频与音频续写 每种任务是否都已出现在当前入口
视频任务 文生视频、图生视频、视频转视频、关键帧生视频 人物连续性、动作和品牌文字是否稳定
开放状态 Video Early Access 访问条款、价格、安全和商用规则
后续计划 图像 Early Access;未来 FLUX 3 Dev 开放权重 计划不等于当前可下载或可商用

FLUX 3 官方发布页

图:Black Forest Labs 的 FLUX 3 发布页,访问于 2026-07-27。页面把 Image、Video、Audio 和 Action 放进同一产品方向,当前可核验重点仍是 Video Early Access。

“原生音频”为什么值得关注

过去的视频生成工作流经常要先做画面,再从另一套模型或素材库补音乐、环境声和对白。FLUX 3 的方向是用一个联合训练图像、视频和音频的多模态基础模型处理这些内容。白话说,就是声音不再只是最后贴上去的附件,而是从生成阶段就与画面一起考虑。

这对短视频团队的价值很具体:开门、落杯、脚步和人物动作可以在同一次生成里出现。但“原生”不等于“自然且准确”。声音事件是否对得上动作,仍然要逐镜头验收;人物说话、品牌名和多语言文案也不能从“支持音频”自动推导出来。

厂商给出的评测数字怎么读

BFL 的初步对比使用 10 秒、720p、带音频的视频。官方公布的偏好结果最高为:对 Grok Imagine Video 69%、Kling v3 Pro 60%、Runway Gen-4.5 77%、Luma Ray 3.2 93%

这些是厂商测试中的人工偏好比例,说明在那套提示词和评测流程下,评审更常选择 FLUX 3。它们不是一个跨任务、跨分辨率、跨版本都成立的总排名。官方也说明评测 harness 仍在发展。真正采购时,团队应使用自己的产品、人物、语言和品牌规范重新测试。

评测记录表至少要留下这些字段

视频评测最容易犯的错,是只保存最后胜出的成片。一份可复查的评测记录表至少要有:任务类型、原始输入、模型或版本标识、生成时间、输出时长与分辨率、是否带音频、人物一致性、文字正确性、动作完成度、音画偏移、失败原因和评审结论。原始文件与失败文件都要保留,不能只留压缩后的展示视频。

做模型对比时,每轮只比较两个匿名输出,并随机交换左右顺序,减少品牌和位置带来的偏见。同一个提示至少覆盖静态产品、快速动作、人物说话和多语言文字等不同难点;如果某项能力当前入口未开放,就记为“未测”,不要用其他任务的结果补空白。

团队还应把“偏好”和“可上线”分成两列。评审更喜欢某条视频,不代表它的品牌文字、人物身份或商用条款已经过关。只有硬性阻断项全部通过后,偏好票数才有采购意义。

电商创意团队:12 个镜头怎么验收

一个电商创意团队可以先准备 12 个短镜头,覆盖三种语言,并为每个镜头写清必须出现的动作和原生音效。保存每次输入、稳定的模型或版本标识、生成时间和原始文件,避免后来分不清是哪次输出。

评审时把问题拆开:人物在连续镜头里是否仍是同一个人;商品包装和品牌文字是否正确;关键动作与声音事件是否对齐;三种语言是否出现错字或混用。RadarAI 建议把 200ms 作为音频事件偏移的暂停线,同时把两个以上镜头的角色漂移、任何品牌文字错误和无法确认的商用条款列为上线阻断项。

这不是 FLUX 3 的公开通过率,而是一套内部上线方法。团队要保留失败样本,尤其是人物变化、文字变形和声音抢跑的片段,因为这些样本比一条最漂亮的展示视频更能说明模型是否适合规模化生产。

值不值得现在申请

对已经有视频生成流程、能做逐镜头验收的专业团队,Early Access 值得测试,尤其是希望减少音频后期拼接的场景。对需要稳定 SLA、明确商用规则或本地开放权重的团队,现在还不是可以直接替换生产管线的状态。FLUX 3 Dev 值得关注,但在权重、许可证和发布日期真正出现前,它仍是一项未来计划。

官方与一手来源

← 返回更多文章