一句话定位
Ray3 是 Luma AI(Palo Alto,视频/3D 生成创业公司)2025-09-18 推出的”推理式视频模型”(reasoning video model),号称世界首个能生成文本+视觉 token 进行自我评判迭代的多模态推理视频系统,并首发原生 10/12/16-bit HDR EXR 视频;它是 Luma 对外反复重申的”多模态即 AGI”世界模型战略的当前旗舰产品,但截至本条目撰写,Luma 未发表任何架构/数据/训练方法的技术论文或系统报告——一切信息均来自产品博客与市场材料。
背景与定位
Luma AI 早期以 NeRF/3D 重建(Luma app)起家,2024 年起转向视频生成(Ray1 → Ray2 → Ray3),并在 2025-11 的融资博客中明确追溯”公司成立近 4 年前就写下’多模态是智能的关键’“。Ray3 之于 Luma,定位类似 genie-3 之于 DeepMind、cosmos-predict2 之于 NVIDIA——都是把”生成式视频”包装为”世界模型”叙事的旗舰产品,但三者的技术透明度差异巨大:
- 与 genie-3(自回归、逐帧、可交互、DeepMind 内部研究项目、无商业 API)不同:Ray3 是面向创作者的商业化产品,走 Dream Machine / API / Adobe Firefly 等分发渠道,其”世界模型”叙事服务于视频生产力(广告、影视、游戏预演),而非交互式环境/机器人仿真。
- 与 cosmos-predict2(NVIDIA 开源权重+论文+训练细节,明确面向机器人/自动驾驶 world model 的物理仿真基座)不同:Ray3 完全闭源,无论文,无开源权重,“世界模型”更多是叙事口径而非可独立验证的物理仿真能力声明。
- 与 world-labs-marble(李飞飞 World Labs 的持久 3D 高斯世界,一次性生成静态可漫游场景)不同:Ray3 走的是视频流(连续帧,非持久 3D 资产),产出是可编辑/可合成的 2D-plus-HDR 视频而非可导出的 3D 几何。
范式命名:Luma 自己没有采用学界的 “world model” 术语体系(RSSM / JEPA / DiT 世界模型),而是用**“multimodal reasoning system”(多模态推理系统)与”AGI is multimodal, reality is the dataset”**(2025-11-19 融资博客标题)两个口号来描述其技术方向——即:通过在文本、视频、图像、音频等所有信号模态上联合训练,让模型学会”理解和模拟宇宙”,Ray3 是这条路线目前唯一对外发布的具体产品。
模型架构
Luma 未披露 backbone 网络结构(DiT/扩散/自回归/JEPA 具体选型)、参数量、latent 维度、tokenizer 细节。 一手材料给出的仅是功能性描述与少量相对量:
- “多模态推理系统”:Ray3 launch blog 原文——“It does this by generating both text and visual tokens, almost like a director sketching out a storyboard before filming”,即模型在渲染前先生成文本 token + 视觉 token两类中间表示,用于理解意图、规划复杂场景、并对自身输出做判断(“judge whether its own output makes sense”)、必要时重试(“retries until your quality bar is met”,见产品页 Chain of Thought 描述)。这是 Ray3 “reasoning” 能力的唯一技术线索,具体实现(是否为独立小模型做 judge、是否复用同一 backbone 的 KV cache 等)未披露。
- 相对规模:CEO Amit Jain 原话——Ray3 “more than twice the size of Ray2”(体量为 Ray2 两倍以上),Ray2 与 Ray3 均未披露绝对参数量。
- 原生分辨率:launch blog 称”Ray3’s architecture has been scaled up to produce crisp, detailed 1080p video natively”,即架构层面针对 1080p 原生生成做了扩容(相对更低分辨率的前代);另配一个神经网络超分模块可从原生分辨率无损放大到 4K(“a neural upscaler that cleanly upscales the output to 4K without introducing blur or motion artifacts”)。
- HDR 生成头:模型可直接输出 10/12/16-bit ACES2065-1 EXR 格式(而非先出 SDR 再后处理转 HDR),并支持把已有 SDR 视频/图像转为”生成式 HDR”(“SDR to Generative HDR”)——具体是独立分支头还是同一 backbone 的不同解码路径未披露。
- Draft Mode / HiFi 两级生成:Draft Mode 用更快/更便宜的路径产出草稿——同一篇 2025-09-18 发布博客内就出现两个不一致的加速倍数:“creatives can explore dozens of ideas up to 20x faster”(导语段),而”Breakthrough Features”小节又写”produces test videos up to 10 times faster than usual”;当前产品页则改述为”5x Faster / 5x Cheaper”。随后用 “Hi-Fi Diffusion” 将选中草稿”master”为 4K HDR 成片;官方强调这一过程”preserves the identity, motion, and composition of the draft”,暗示两级之间存在某种条件化/一致性约束机制,但未披露具体是否为同一模型的不同采样步数、还是级联的两个模型。
- 后续版本 Ray3.14(2026-01)与 Ray3.2(API 当前版本)在原生分辨率、速度、多关键帧(最多 16 个关键帧/单镜头)、V2V 时长(最长 20 秒)上持续迭代,但同样不披露架构变化的具体机制。
数据
训练数据的规模、来源、配比、清洗、动作/字幕标注——Luma 完全未披露。 无论是产品博客、评测报告还是融资博客都没有给出训练语料的小时数/帧数/来源占比。可间接推断的仅有:
- Luma 的 2025-11 融资博客明确将”reality”(video/3D/audio/image 等物理世界信号)定性为”AGI 的数据集”,暗示训练数据战略上强调多模态真实世界信号的联合训练,而非纯文本/纯合成。
- Ray3 支持从任意图像/视频做参考驱动生成(Character Reference、Modify Video 的 wardrobe swap / relighting / environment swap 等),暗示训练集覆盖大量人物/场景/光照变化的成对或参考式样本,但具体构造方式未披露。
- Draft Mode 与 HiFi 两级生成的训练数据是否共享、是否存在专门的”精修”数据集,未披露。
训练方法
训练目标函数、多阶段流水线、RL/模仿学习占比、蒸馏细节、关键超参——均未披露。 Luma 自 2025-03 起发表过两篇独立的生成建模研究博客(Inductive Moment Matching,2025-03;Terminal Velocity Matching,2025-11),提出”少步(4 步)高质量生成”的训练范式,且 TVM 博客称已可扩展到 10B+ 参数的扩散 Transformer;但这两篇博客均以独立的 Text-to-Image 模型作为展示对象,官方原文并未声明 Ray3 使用了 IMM/TVM 作为训练目标,因此不能把它们当作 Ray3 的训练方法直接归因,此处仅作为 Luma 同期生成式建模研究方向的背景参考,不计入 Ray3 自身的已披露训练方法。
Ray3 “reasoning” 能力(生成文本+视觉 token、自我评判、重试)的训练方式——是否涉及额外的判别器/奖励模型、是否有专门的 RL 阶段——未披露。
Infra(训练 / 推理工程)
训练 Infra(GPU 型号/数量、GPU-hours、并行策略、精度):未披露。
推理侧:
- Draft Mode 相对标准渲染路径的加速倍数在一手材料中不一致:“up to 20x faster”(launch blog 导语)/ “up to 10 times faster”(同一篇 launch blog 的 Breakthrough Features 小节)/ “5x Faster”(当前产品页),均无绝对延迟数字(如秒/帧)。
- Ray3.14(2026-01 更新)宣称相对此前版本”4x faster performance…3x lower cost”,同样为相对倍数、无绝对推理延迟或吞吐披露。
- 无 GPU 型号、无部署拓扑、无 FPS/控制频率等机器人式指标(Ray3 是离线视频生成,非闭环实时控制模型,此类指标本身不适用)。
- 算力扩张的唯一具体数字来自融资博客而非 Ray3 本身:2025-11 与 Humain 合作建设代号 “Project Halo” 的 2GW 算力超级集群,2026 Q1 起分阶段部署,2028-29 完工,用于训练与推理,服务于 Luma 整个多模态模型路线(不特定于 Ray3)。
评测 benchmark
一手材料给出的是独立第三方评测的定性结论,未在文本中提供可复核的具体分数:
- 2025-10-14《Ray3 Evaluation Report》原文——“Third-party quantitative evaluations show Ray3 reaching state-of-the-art performance alongside Veo3, while maintaining a significant and definitive lead over every other industry model — Midjourney Video, Runway Gen-4, and Moonvalley Marey。”
- 评测维度:Physics & Motion Performance、Instruction-Following(“SOTA precision…matching Veo3”)、Motion Artifacts(“far less often and far less severely than any other video model”)、Aesthetic Quality(“ahead of every competitor”)、Dynamic Range and Color(“the only generative video model capable of producing true HDR”)、Temporal Consistency(“highest…across all measured competitors”)、Image-to-Video Adherence(“near parity with SOTA [Veo3]…decisive lead over all other models”)。
- 每个维度均配有柱状图(评测报告 PDF/网页图片),但图表数值本身无法从网页文本中提取,评测方法论也只描述为”内部结构化分析 + 独立评审的双层评测”,未公开评委人数、样本集组成、打分量表或统计显著性检验。
- 无公开 benchmark 数据集名称(如 VBench、EvalCrafter 等标准视频生成评测集)被引用,评测样本为 Luma 自建的”数千条覆盖不同 prompt/风格/难度的生成视频”。
- 如实记录:Ray3 无可独立复核的定量评测数字,其”State-of-the-Art”论证完全依赖 Luma 自述的第三方评审结论与图表可视化。
创新点与影响
贡献(按一手源自陈)
- 自称”世界首个推理式视频模型”(world’s first reasoning video model):在渲染前生成文本+视觉 token 做意图理解、场景规划与自我评判,把视频生成从”一次性采样”改造为”生成-评判-重试”的迭代流程。
- 自称首个原生生成真 HDR(10/12/16-bit ACES2065-1 EXR)的生成式视频模型,直接对接专业调色/合成流水线(Resolve/Nuke)。
- Draft Mode + Hi-Fi 两级生成,把”低成本快速探索”与”高保真终版渲染”解耦,试图解决生成式创作中”试错成本高”的核心痛点。
- 商业分发上第一时间进入 Adobe Firefly(首个在 Dream Machine 之外落地 Ray3 的合作伙伴),推动生成视频进入主流专业创作工具链。
- 公司层面把 Ray3 包装为”AGI is multimodal, reality is the dataset”战略的第一个具体证明点,并据此在 2025-11 融资 9 亿美元、启动 2GW 的 Project Halo 超算集群,团队扩张至 130+ 研究/工程/创意/运营人员——即用一个视频产品的商业成功去论证一个通往 AGI/世界模型的更大叙事。
改变了什么:把”生成式视频”的竞争维度从单纯的画面质量/物理真实感,扩展到”推理能力”(自我评判/迭代)与”专业级色彩管线”(HDR EXR)两个新轴,并推动 Adobe 级专业工具原生集成 AI 视频模型。
自陈局限 / 本条目核实到的局限
- 官方评测报告承认其评测框架是自建的(“most existing evaluation methods for video generation… remain underspecified”),言下之意是采用了非标准化的私有评测集,读者无法用第三方公开 benchmark 复核。
- 官方产品页与融资博客文本中未出现任何架构图、参数表或数据集说明——透明度层面本条目将其定性为”世界模型强口径、无对应技术论文”的商业产品,而非可独立复现的研究工作。
- 原生 1080p 在发布时仅限”部分合作伙伴早期访问”,非全量可用(launch blog 原文)。
- Draft Mode 加速倍数在同一篇发布博客内部就出现 20x 与 10x 两个不同数字,与当前产品页的 5x、以及 Ray3.14 更新博客的 4x/3x 又各不相同,反映这些数字更接近市场宣传口径而非严格可复现的基准测试结果。
原始链接
- Ray3 产品页:https://lumalabs.ai/ray3
- Ray3 发布博客(2025-09-18):https://lumalabs.ai/news/ray3
- Ray3 评测报告博客(2025-10-14):https://lumalabs.ai/news/ray3-eval
- 融资/战略博客”AGI is multimodal…”(2025-11-19):https://lumalabs.ai/news/series-c
- Luma News 总览:https://lumalabs.ai/news
- API / 定价(当前 Ray3.2):https://lumalabs.ai/api
- Inductive Moment Matching(背景研究,非声明用于 Ray3):https://arxiv.org/pdf/2503.07565
- Terminal Velocity Matching(背景研究,非声明用于 Ray3):https://lumalabs.ai/news/tvm
一手源存档(sources/)
- luma-ray3-world-models—project-page — Ray3 产品页快照
- luma-ray3-world-models—launch-blog — 2025-09-18 发布博客快照
- luma-ray3-world-models—eval-report-blog — 2025-10-14 评测报告博客快照
- luma-ray3-world-models—series-c-blog — 2025-11-19 融资/战略博客快照
- luma-ray3-world-models—api-page — 当前 API/定价页快照(用于说明模型线演进,非 Ray3 发布时配置)