一句话定位

Ray2 是 Luma AI 于 2025 年 1 月中旬上线 Dream Machine 的第二代闭源视频生成模型——官方口径称其训练于”新的多模态架构,算力规模是 Ray1 的 10 倍”,主打更连贯的运动、更真实的细节与更符合逻辑的事件序列;首发只有文生视频,图生视频/视频到视频/编辑”即将推出”,随后数周内以 API 形式(model="ray-2",配套自然语言驱动的镜头运动、关键帧续写/反向续写/插值等能力)陆续补齐。Luma 未发表任何架构、数据或训练方法的技术论文——一切信息均来自产品页与开发者文档。

背景与定位

Luma AI(Palo Alto)早期以 NeRF/3D 重建产品起家,2024 年 6 月发布 Ray1(Dream Machine 首代视频模型)后转向视频生成主线。Ray2 是这条产品线的第二代,2025 年 1 月上线,随后在 2025-09 迭代为 Ray3、2026 年再迭代为 Ray3.14 / Ray3.2(后两者见 luma-ray3-world-modelsluma-ray3-14)。

Ray2 所处的时间点上,闭源商业视频生成正处于多家厂商同场竞速阶段,同期/相近对手包括 Google Veo(veo-3)、OpenAI Sora(sora-2)、快手可灵(kling-2)等;Ray2 launch 页面把自己定位为”a new generation of video models”,强调”success rate of usable generations”这一生产可用性指标,而非单纯的画面美观度。

关于”世界模型”框架:Ray2 发布材料本身没有使用 “world model” 一词,只是在展示分类里放了一栏 “Physics and Simulation”。Luma 把自己的技术路线明确包装为”多模态即 AGI、现实是 AGI 的数据集”的世界模型叙事,是在其后 2025-11-19 的融资博客(“AGI is multimodal and reality is the dataset of AGI”)里才正式对外系统阐述,并把彼时最新的 Ray3 称为”世界首个推理式视频模型”;该框架与更细节的 Ray3 世界模型定位分析见 luma-ray3-world-models,本页不重复展开,仅指出 Ray2 是这条叙事线上早于该口径正式提出的一代产品。

模型架构

Luma 官方未公开 backbone 选型(DiT/扩散/自回归等)、参数量、latent 维度或 tokenizer 细节——这是 Luma 视频模型线的一贯做法(Ray3 同样未披露,见 luma-ray3-world-models)。可确证的一手信息仅有:

  • 规模声明:launch 页原文——“Ray2 exhibits advanced capabilities as a result of being trained on Luma’s new multi-modal architecture scaled to 10x compute of Ray1”。这是 Ray2 与前代唯一可确证的定量关系(相对算力倍数,非绝对 FLOPs/GPU-hours)。

  • 多模态条件输入:模型可接受文本、图像、视频作为条件(launch 页:“can take image and video as input”),对应 API 侧的能力矩阵(见下)。

  • 模型家族/版本参数(API model 字段,2025-04 文档确证):

    名称model 参数
    Ray 2 Flashray-flash-2
    Ray 2ray-2
    Ray 1.6(上一代)ray-1-6

    Ray 2 Flash 是速度/成本优化的变体,具体加速机制(蒸馏/更少采样步数/更小模型)未披露;上线的确切日期本页未能定位一手确证时间,仅确证其在 2025-04-23 的 API 文档快照中已列入模型表。

  • 生成条件化原语(API 暴露的能力,构成 Ray2 的”可控性”接口):

    • keyframes.frame0 / frame1 可各自为 {"type":"image","url":...}{"type":"generation","id":...},组合出:图生视频(起始帧)、指定尾帧、起止双关键帧、续写已有生成(extend)、反向续写(reverse extend,生成一段导向已有片段的视频)、两段已有生成间插值(interpolate)。
    • aspect_ratioloop(循环视频)参数。
    • 摄像机运动:通过自然语言短语注入 prompt 实现(而非结构化数值参数),可用短语通过 camera_motion.list() 端点查询获取(如 “camera orbit left”),文档说明”syntactically similar phrases also work, though there can be mismatches sometimes”。
    • callback_url:异步任务状态回调(dreaming/completed/failed 及最终视频 URL),非 200 响应重试 3 次、间隔 100ms、超时 5s。
    • 分辨率梯度:540p / 720p / 1080p / 4k(2025-02 起 4K 可直接生成,此前 540p/720p 视频可事后 upscale 到更高档)。

未披露:注意力/时序建模具体机制、原生训练分辨率、单次生成的绝对参数量、text encoder 选型。

数据

完全未披露。 Luma 从未公开 Ray2 的训练数据规模(小时数/帧数/视频对数)、来源构成、清洗/过滤流程、动作或字幕标注方式、是否使用合成数据、真实与仿真数据配比等任何细节。产品页与开发者文档均只字未提数据集。这与 Ray3(见 luma-ray3-world-models)的透明度一致——Luma 迄今为止的整条视频模型线都不发表数据说明。

训练方法

未披露。 官方仅有一句定性描述——“trained on Luma’s new multi-modal architecture scaled to 10x compute of Ray1”——没有给出训练目标函数(扩散/流匹配/自回归)、多阶段训练流水线、是否有 RLHF/偏好对齐、蒸馏方案或关键超参数。Ray2 Flash 相对 Ray2 的加速化处理方式(是否为步数蒸馏/更小模型/量化)同样未披露。

Infra(训练 / 推理工程)

训练侧(GPU 型号/数量、GPU-hours、并行策略、精度):完全未披露。

推理/产品工程侧(一手确证的具体数字):

  • 异步生成模型POST /dream-machine/v1/generations 创建任务,通过轮询或 callback_url 获取 dreaming → completed/failed 状态流转;dreaming 状态下即可拿到渐进式预览 assets.progress_video(2025-02 上线)。
  • 分辨率与定价(Ray 2,5 秒视频,2025-02 时点):直接生成 1080p = 0.95 美元、4K = 1.05 美元;事后 upscale(540p→720p 0.31、540p→1080p 0.46、540p→4k 0.56、720p→1080p 0.15、720p→4k 0.25、1080p→4k 0.10 美元),upscale 计费与画幅/像素数无关,为固定费率。
  • 分发形态:Web + iOS App(Dream Machine)、开发者 API(api.lumalabs.ai/dream-machine/v1/generations)、Python/JS SDK(lumaai on PyPI/npm)。首发仅面向 Dream Machine 付费订阅用户开放,API 接入”soon”(随后数周内上线)。
  • 无 GPU 型号、无推理延迟/吞吐(秒/请求)、无训练算力规模等数字被公开。

评测 benchmark

Luma 未发布任何量化评测。 launch 页以九个能力展示分类(Natural Motion、Instruction Following、Physics and Simulation、Photorealism、Cinematic Scenes、People and Expressions、Surrealism、World Exploration、Visual Effects、Closeup Details)陈列示例视频与对应 prompt,用于定性展示能力,不含任何 VBench/FVD/FID 等标准指标,也没有与 Sora/Veo/Kling 等竞品的对比数字。Ray2 发布材料中没有第三方评测报告——这一点与 Ray3 发布后曾配发的《Ray3 Evaluation Report》(见 luma-ray3-world-models)不同,Ray2 完全没有对应的评测博客。

创新点与影响

贡献(按一手源自陈)

  1. 官方宣称的”10 倍 Ray1 算力”规模跃升,用以支撑”更连贯运动、更真实细节、更合逻辑的事件序列”这一代际能力声明,核心卖点是可用生成的成功率提升(生产可用性),而非单纯画质。
  2. 把关键帧的”续写 / 反向续写 / 双关键帧插值”统一成同一套 keyframes API 原语(frame0/frame1 既可指向一张图片也可指向一个已完成的生成结果),是 Ray2 API 侧对创作工作流(起止帧导演、循环、视频延展)的抽象。
  3. 摄像机运动走”自然语言短语注入 prompt + 可查询短语表”的路线,而非结构化数值参数,是 Ray2 一代产品在可控性上的取舍。
  4. 定价与分辨率梯度(540p/720p/1080p/4K 直接生成 + 事后 upscale)把”先出低分辨率草稿、按需高清放大”产品化为独立计费项,是视频生成产品的成本工程实践之一。
  5. Ray2 是 Luma 后续把整条产品线包装为”多模态世界模型/AGI”叙事(详见 luma-ray3-world-models)之前的一代产品——该叙事在 Ray2 发布时尚未正式提出,Ray2 本身的市场材料只字未提”world model”。

已知局限(本条目核实到的)

  • 闭源、无论文、无开源权重:架构、数据、训练方法、训练算力规模全部不可验证,只能依赖 Luma 自述的相对倍数声明(“10x compute of Ray1”)。
  • 无任何第三方或官方量化评测数字,“更连贯运动/更真实细节”等能力声明缺乏可复核的基准支撑。
  • 首发时图生视频、视频到视频、编辑能力均处于”coming soon”状态,并非发布当天即完整可用。
  • confidence=med(词条元数据标注):Ray2 定位为 Luma 视频模型线上的一个迭代节点,其”世界模型”标签更多来自后续 Ray3 阶段的市场叙事回溯适用,而非 Ray2 自身发布时的明确定位。

原始链接

一手源存档(sources/)