一句话定位

一篇自称”AI 生成的 VLA 综述”的 arXiv 投稿:30 余位作者挂名 Kazakhstan 一家 Tactile Robotics Laboratory,摘要坦承内容由 LLM 生成、“不代表原创研究”,但正文充满未清理的 LLM 对话残留、虚构模型/数据集、张冠李戴的作者与基金号,最终于提交近 4 个月后被 arXiv 管理员以”严重违反可接受提交政策”为由整篇撤稿——它在本库中的价值不是技术内容(正文没有任何可信的技术内容),而是作为”LLM 自动化文献综述”这一方法论尝试的一次公开、可追溯的失败样本。

背景与定位

2025 年前后,“用 LLM 自动生成文献综述”开始被一些团队当作真实的研究方法论去尝试(呼应本库 embodied-benchmark-survey 等由人类作者主导、逐篇精读原文写就的综述所代表的正统路径)。本文是这类尝试中一个被记录在案的失败案例:摘要开宗明义写道该综述”由大语言模型生成”、“仅用于演示目的”、“不代表原创研究”,并把”如何提升引用准确性、来源可信度与上下文理解”列为未来工作——即作者自己承认现有产出尚未达到可发表标准,却依然把它作为正式论文投上了 arXiv。

提交记录清晰可查:v1 于 2025-02-07 提交(18 KB,完整 14 页正文,仍可在 arxiv.org/pdf/2502.06851v1 下载),v2 于 2025-02-15 重新提交(同为 18 KB,内容未见实质改动),v3 于 2025-06-02 被替换为 1 KB 的占位文件并标注 (withdrawn)——此时 arXiv 摘要页顶部出现管理员横幅”This paper has been withdrawn by arXiv Admin”,Comments 字段写明”arXiv admin note: This submission has been withdrawn due to serious violation of arXiv policies for acceptable submissions”。也就是说,这篇文章不是作者主动撤回,而是被平台管理方强制下架。

模型架构

正文没有描述任何一个由本文作者提出、可验证存在的模型架构。取而代之的是明显未经清理的 LLM 生成痕迹与虚构内容,逐一列举如下(均为一手核实,见 sources/ 存档):

  • 全文 Introduction 之后紧跟的第一段正文标题是”Section V: Conclusion”(本应是全文末尾的结论,却出现在开头),其中”介绍”了一个名为 Actra 的”新方法”——号称结合”轨迹注意力(trajectory attention)“与”可学习动作查询(learnable action queries)“来优化边缘设备上的机器人推理——但通篇找不到任何架构图、公式、参数量或训练细节;这是一个凭空出现、此前从未在正文其他位置定义过的模型名。
  • 同一段落还提到一个”大规模多模态数据集”ProSim-Instruct-520k,描述为”超过 520K 个真实世界驾驶场景、逾 1000 万条文本提示”——这是自动驾驶数据集的描述口径,与”VLA 机器人操作综述”的主题完全不相关,怀疑是模型把不相关领域的训练素材(可能是某自动驾驶 world model 数据集的表述)串接进了当前上下文。
  • 正文反复出现未被清理的 LLM 对话式前缀,例如”Certainly! Here is the section of the review paper written in a more human-readable format:”、“Sure, here is a rewritten version of the section of the review paper as if a human would do it:“,这些原本应是模型对提示词的回应开场白,被直接当作论文正文段落粘贴进 LaTeX 源码并编译发布。
  • 章节编号本身自相矛盾、不连续:Introduction 之后直接是”Section V”,稍后又出现独立的”Section II: Vision Transformer”,多处子章节标题(如”3.1 Data Representation”)在文中重复出现两次、内容却互不衔接。

数据

正文第 3.3 节列出一批”用于具身 VLM 的数据集”,给出的规模数字与真实数据集不符或无法溯源(本节内容原样转述自正文,标注为虚构/未经证实,不代表这些数据集的真实规模):

  • “Replica 数据集”被描述为”1080 张 RGB-D 图像、26 个场景的 2D/3D 语义分割标签”;
  • “Gibson 数据集”被描述为”超过 18000 张 RGB-D 图像”;
  • “Habitat 数据集”被描述为”超过 2500 个场景与 9 万+ 物体实例”;
  • “AI2-THOR”被描述为”11 个环境中超过 26000 个任务”;
  • “RoboTHOR”被描述为”超过 10000 个任务和 26000 个场景”;
  • “Open-X-Embodiment”被描述为”覆盖多机器人多环境的超过 1000 个任务”——而本库 open-x-embodiment 页面基于该数据集论文一手核实的真实规模是 60 个数据集、34 个实验室、22 种机器人本体、100 万+ 条真机轨迹、160266 个任务,“超过 1000 个任务”对真实规模的量级低估了两个数量级以上。

第 4.2 节又出现一段声称对”Franka Research 3 机械臂 + 三台 RealSense D435 相机”的真实数据采集与实验,描述”8 个真实任务、每任务 100 条演示、额外 10 条遥操作演示”,但这与摘要自陈”本文未开展原创研究”直接矛盾——本文没有做过任何实验,这段内容读起来像是从其他机器人学习论文里被模型直接挪用/编造的实验叙述。

训练方法

同样不存在。文中出现的”训练方法”描述全部依附在虚构模型 Actra 或虚构实验之上:例如声称”仿真数据训练策略成功率约 70%""纯真实数据训练约 50%""仿真+真实联合训练约 80%“,以及”PPO 算法在 Franka Kitchen 环境上达到 75% 成功率、60 步轨迹长度”——这些数字之间彼此不矛盾得刻意”整齐”(70/50/80、75%),符合 LLM 编造对比实验时常见的”合理但无依据”的数字生成模式,无法追溯到任何可验证的训练配置、超参数或代码。

Infra(训练 / 推理工程)

未披露——本文自称未开展原创研究,不存在真实的训练/推理算力信息;正文中出现的”实验硬件”(Franka Research 3、RealSense D435)同样缺乏可验证的算力、并行策略或推理延迟数据支撑。

评测 benchmark

本文不构成任何可信的评测结果来源。正文出现的量化数字(sim-only 70%、real-only 50%、combined 80%、PPO on Franka Kitchen 75%/60 帧等)均无法与任何已发表的基线论文对应,也未提供代码、日志或可复现协议;因此本条目在”评测”维度上的准确记录应为:本文不提供任何可信的 benchmark 结果

创新点与影响

这篇文章实际”贡献”的不是 VLA 技术,而是一份可公开追溯的失败样本

  1. 它证明了”直接把 LLM 生成的文献综述草稿投稿到 arXiv”这条路径在 2025 年初的实践中会产出无法通过基本事实核查的文本——虚构模型名(Actra)、虚构数据集(ProSim-Instruct-520k)、张冠李戴的作者与基金号、未清理的对话式 LLM 输出、自相矛盾的章节编号,这些问题共同出现在同一篇 14 页的投稿里。
  2. 它记录了 arXiv 审核机制对此类提交的实际处置结果:论文在挂网近 4 个月后被平台管理员而非作者本人强制撤稿,撤稿理由明确写为”严重违反可接受提交政策”,而非普通的”作者主动撤回”或”发现错误后修订”。
  3. 对本库的意义:它是”LLM 辅助文献综述”这一方法论方向上一个真实发生、有据可查的反面案例,可与 efficient-vla-models-surveylarge-vlm-vla-manipulation-survey 等由人类作者逐篇精读原文写就、可验证具体数字的正统 VLA 综述并列对照,用以说明”AI 生成综述”若跳过人工事实核查会具体失败在哪些环节(虚构实体、虚构数字、身份/致谢混淆、未清理生成痕迹)。

论文自陈的”局限”(摘要原文):作者承认”确保准确性、可靠性与恰当综合仍是挑战”,并把”提升引用准确性、来源可信度与上下文理解”列为未来工作方向——但这些”未来工作”实际上是这篇已发表投稿本身完全未达标的项目,而非对已有工作的增量改进。

原始链接

一手源存档(sources/)

  • survey-on-vla-models—arxiv-abs — arXiv 摘要页快照(标题、全部 32 位作者、完整摘要原文、Comments 撤稿公告、v1/v2/v3 提交历史与文件大小、正文中虚构内容/未清理 LLM 残留的逐条核实摘录)
  • arXiv v1 原文 PDF/HTML,不入 git(https://arxiv.org/pdf/2502.06851v1,14 页,2025-02-07 提交;canonical /pdf/2502.06851(无版本号)现返回 404,因 v3 已被撤稿替换为 1 KB 占位文件)