一句话定位
Ray2 是 Luma AI 于 2025 年 1 月中旬上线 Dream Machine 的第二代闭源视频生成模型——官方口径称其训练于”新的多模态架构,算力规模是 Ray1 的 10 倍”,主打更连贯的运动、更真实的细节与更符合逻辑的事件序列;首发只有文生视频,图生视频/视频到视频/编辑”即将推出”,随后数周内以 API 形式(model="ray-2",配套自然语言驱动的镜头运动、关键帧续写/反向续写/插值等能力)陆续补齐。Luma 未发表任何架构、数据或训练方法的技术论文——一切信息均来自产品页与开发者文档。
背景与定位
Luma AI(Palo Alto)早期以 NeRF/3D 重建产品起家,2024 年 6 月发布 Ray1(Dream Machine 首代视频模型)后转向视频生成主线。Ray2 是这条产品线的第二代,2025 年 1 月上线,随后在 2025-09 迭代为 Ray3、2026 年再迭代为 Ray3.14 / Ray3.2(后两者见 luma-ray3-world-models、luma-ray3-14)。
Ray2 所处的时间点上,闭源商业视频生成正处于多家厂商同场竞速阶段,同期/相近对手包括 Google Veo(veo-3)、OpenAI Sora(sora-2)、快手可灵(kling-2)等;Ray2 launch 页面把自己定位为”a new generation of video models”,强调”success rate of usable generations”这一生产可用性指标,而非单纯的画面美观度。
关于”世界模型”框架:Ray2 发布材料本身没有使用 “world model” 一词,只是在展示分类里放了一栏 “Physics and Simulation”。Luma 把自己的技术路线明确包装为”多模态即 AGI、现实是 AGI 的数据集”的世界模型叙事,是在其后 2025-11-19 的融资博客(“AGI is multimodal and reality is the dataset of AGI”)里才正式对外系统阐述,并把彼时最新的 Ray3 称为”世界首个推理式视频模型”;该框架与更细节的 Ray3 世界模型定位分析见 luma-ray3-world-models,本页不重复展开,仅指出 Ray2 是这条叙事线上早于该口径正式提出的一代产品。
模型架构
Luma 官方未公开 backbone 选型(DiT/扩散/自回归等)、参数量、latent 维度或 tokenizer 细节——这是 Luma 视频模型线的一贯做法(Ray3 同样未披露,见 luma-ray3-world-models)。可确证的一手信息仅有:
-
规模声明:launch 页原文——“Ray2 exhibits advanced capabilities as a result of being trained on Luma’s new multi-modal architecture scaled to 10x compute of Ray1”。这是 Ray2 与前代唯一可确证的定量关系(相对算力倍数,非绝对 FLOPs/GPU-hours)。
-
多模态条件输入:模型可接受文本、图像、视频作为条件(launch 页:“can take image and video as input”),对应 API 侧的能力矩阵(见下)。
-
模型家族/版本参数(API
model字段,2025-04 文档确证):名称 model 参数 Ray 2 Flash ray-flash-2Ray 2 ray-2Ray 1.6(上一代) ray-1-6Ray 2 Flash 是速度/成本优化的变体,具体加速机制(蒸馏/更少采样步数/更小模型)未披露;上线的确切日期本页未能定位一手确证时间,仅确证其在 2025-04-23 的 API 文档快照中已列入模型表。
-
生成条件化原语(API 暴露的能力,构成 Ray2 的”可控性”接口):
keyframes.frame0/frame1可各自为{"type":"image","url":...}或{"type":"generation","id":...},组合出:图生视频(起始帧)、指定尾帧、起止双关键帧、续写已有生成(extend)、反向续写(reverse extend,生成一段导向已有片段的视频)、两段已有生成间插值(interpolate)。aspect_ratio、loop(循环视频)参数。- 摄像机运动:通过自然语言短语注入 prompt 实现(而非结构化数值参数),可用短语通过
camera_motion.list()端点查询获取(如 “camera orbit left”),文档说明”syntactically similar phrases also work, though there can be mismatches sometimes”。 callback_url:异步任务状态回调(dreaming/completed/failed及最终视频 URL),非 200 响应重试 3 次、间隔 100ms、超时 5s。- 分辨率梯度:540p / 720p / 1080p / 4k(2025-02 起 4K 可直接生成,此前 540p/720p 视频可事后 upscale 到更高档)。
未披露:注意力/时序建模具体机制、原生训练分辨率、单次生成的绝对参数量、text encoder 选型。
数据
完全未披露。 Luma 从未公开 Ray2 的训练数据规模(小时数/帧数/视频对数)、来源构成、清洗/过滤流程、动作或字幕标注方式、是否使用合成数据、真实与仿真数据配比等任何细节。产品页与开发者文档均只字未提数据集。这与 Ray3(见 luma-ray3-world-models)的透明度一致——Luma 迄今为止的整条视频模型线都不发表数据说明。
训练方法
未披露。 官方仅有一句定性描述——“trained on Luma’s new multi-modal architecture scaled to 10x compute of Ray1”——没有给出训练目标函数(扩散/流匹配/自回归)、多阶段训练流水线、是否有 RLHF/偏好对齐、蒸馏方案或关键超参数。Ray2 Flash 相对 Ray2 的加速化处理方式(是否为步数蒸馏/更小模型/量化)同样未披露。
Infra(训练 / 推理工程)
训练侧(GPU 型号/数量、GPU-hours、并行策略、精度):完全未披露。
推理/产品工程侧(一手确证的具体数字):
- 异步生成模型:
POST /dream-machine/v1/generations创建任务,通过轮询或callback_url获取dreaming → completed/failed状态流转;dreaming状态下即可拿到渐进式预览assets.progress_video(2025-02 上线)。 - 分辨率与定价(Ray 2,5 秒视频,2025-02 时点):直接生成 1080p = 0.95 美元、4K = 1.05 美元;事后 upscale(540p→720p 0.31、540p→1080p 0.46、540p→4k 0.56、720p→1080p 0.15、720p→4k 0.25、1080p→4k 0.10 美元),upscale 计费与画幅/像素数无关,为固定费率。
- 分发形态:Web + iOS App(Dream Machine)、开发者 API(
api.lumalabs.ai/dream-machine/v1/generations)、Python/JS SDK(lumaaion PyPI/npm)。首发仅面向 Dream Machine 付费订阅用户开放,API 接入”soon”(随后数周内上线)。 - 无 GPU 型号、无推理延迟/吞吐(秒/请求)、无训练算力规模等数字被公开。
评测 benchmark
Luma 未发布任何量化评测。 launch 页以九个能力展示分类(Natural Motion、Instruction Following、Physics and Simulation、Photorealism、Cinematic Scenes、People and Expressions、Surrealism、World Exploration、Visual Effects、Closeup Details)陈列示例视频与对应 prompt,用于定性展示能力,不含任何 VBench/FVD/FID 等标准指标,也没有与 Sora/Veo/Kling 等竞品的对比数字。Ray2 发布材料中没有第三方评测报告——这一点与 Ray3 发布后曾配发的《Ray3 Evaluation Report》(见 luma-ray3-world-models)不同,Ray2 完全没有对应的评测博客。
创新点与影响
贡献(按一手源自陈)
- 官方宣称的”10 倍 Ray1 算力”规模跃升,用以支撑”更连贯运动、更真实细节、更合逻辑的事件序列”这一代际能力声明,核心卖点是可用生成的成功率提升(生产可用性),而非单纯画质。
- 把关键帧的”续写 / 反向续写 / 双关键帧插值”统一成同一套
keyframesAPI 原语(frame0/frame1既可指向一张图片也可指向一个已完成的生成结果),是 Ray2 API 侧对创作工作流(起止帧导演、循环、视频延展)的抽象。 - 摄像机运动走”自然语言短语注入 prompt + 可查询短语表”的路线,而非结构化数值参数,是 Ray2 一代产品在可控性上的取舍。
- 定价与分辨率梯度(540p/720p/1080p/4K 直接生成 + 事后 upscale)把”先出低分辨率草稿、按需高清放大”产品化为独立计费项,是视频生成产品的成本工程实践之一。
- Ray2 是 Luma 后续把整条产品线包装为”多模态世界模型/AGI”叙事(详见 luma-ray3-world-models)之前的一代产品——该叙事在 Ray2 发布时尚未正式提出,Ray2 本身的市场材料只字未提”world model”。
已知局限(本条目核实到的)
- 闭源、无论文、无开源权重:架构、数据、训练方法、训练算力规模全部不可验证,只能依赖 Luma 自述的相对倍数声明(“10x compute of Ray1”)。
- 无任何第三方或官方量化评测数字,“更连贯运动/更真实细节”等能力声明缺乏可复核的基准支撑。
- 首发时图生视频、视频到视频、编辑能力均处于”coming soon”状态,并非发布当天即完整可用。
confidence=med(词条元数据标注):Ray2 定位为 Luma 视频模型线上的一个迭代节点,其”世界模型”标签更多来自后续 Ray3 阶段的市场叙事回溯适用,而非 Ray2 自身发布时的明确定位。
原始链接
- Ray2 产品页(现已被 Ray3.2 覆盖,历史内容见下方存档):https://lumalabs.ai/ray2 → 现重定向至 https://lumalabs.ai/ray
- Dream Machine 首页:https://lumalabs.ai/dream-machine
- API 文档 - Video Generation:https://docs.lumalabs.ai/docs/video-generation
- API 文档 - Python SDK Video Generation:https://docs.lumalabs.ai/docs/python-video-generation
- API Changelog - Upscale up to 4K, Progress updates:https://docs.lumalabs.ai/changelog/upscale
- Luma News(后续 Ray2 相关公告,如 2025-04-24 “Ray2 is coming to Adobe Firefly”):https://lumalabs.ai/news
- Luma 融资/AGI 战略博客(2025-11-19,“世界模型”叙事正式提出处,非 Ray2 发布时材料):https://lumalabs.ai/news/series-c
一手源存档(sources/)
- luma-ray2—launch-page.md — 2025-01-15 Wayback 快照,Ray2 发布落地页原文
- luma-ray2—api-video-generation-early.md — 2025-02-17 Wayback 快照,Python SDK 文档(关键帧/续写/插值/摄像机运动/回调已上线)
- luma-ray2—api-models-resolution.md — 2025-04-23 Wayback 快照,REST 文档(模型表 ray-2/ray-flash-2/ray-1-6 + 分辨率枚举)
- luma-ray2—upscale-pricing-changelog.md — 2025-03-20 Wayback 快照(对应 ~2025-02-21 发布),4K 直出 + upscale 定价表