AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: vla
此标签下有81条笔记。
2026年7月16日
具身智能技术演进调研(2017 → 2026)· 主汇总
embodied-ai
vla
manipulation
humanoid
locomotion
navigation
robot-learning
simulation
teleoperation
survey
2026年7月16日
Foundation Models in Robotics: Applications, Challenges, and the Future
survey
foundation-models
robotics
vlm
llm
robot-transformers
vla
embodied-ai
uncertainty-quantification
safety
2026年7月16日
Open X-Embodiment: Robotic Learning Datasets and RT-X Models
cross-embodiment
robot-dataset
rt-x
rt-1-x
rt-2-x
vla
rlds
imitation-learning
positive-transfer
generalist-policy
2026年7月16日
PaLM-E: An Embodied Multimodal Language Model
palm-e
embodied-multimodal
vla
palm
vit-22b
osrt
neural-scene-representation
positive-transfer
high-level-planning
ok-vqa
catastrophic-forgetting
frozen-llm
2026年7月16日
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
rt-2
vla
vision-language-action
pali-x
palm-e
co-fine-tuning
action-as-text-token
emergent-reasoning
chain-of-thought
closed-loop-control
2026年7月16日
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI
embodied-ai
survey
vla
world-model
sim-to-real
embodied-perception
vln
embodied-qa
simulators
mllm-agent
2026年7月16日
GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
vla
video-generation
generative-pretraining
world-model
manipulation
cvae
action-chunking
calvin
bin-picking
bytedance
2026年7月16日
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
vla
diffusion-transformer
componentized-vla
prismatic-vlm
llama-2
open-x-embodiment
action-ensemble
simpler-env
robot-manipulation
2026年7月16日
DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution
vla
early-exit
dynamic-inference
efficient-inference
robotflamingo
calvin
edge-deployment
neurips-2024
2026年7月16日
Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning
vla
diffusion-policy
autoregressive-reasoning
reasoning-injection
film
qwen2-vl
robot-foundation-model
model-scaling
icml2025
2026年7月16日
Latent Action Pretraining from Videos (LAPA)
vla
latent-action
vq-vae
video-pretraining
unsupervised
cross-embodiment
openvla
iclr-2025
2026年7月16日
OpenVLA: An Open-Source Vision-Language-Action Model
vla
open-source
open-x-embodiment
prismatic-vlm
llama-2
action-tokenization
lora
quantization
generalist-manipulation
robot-learning
2026年7月16日
π0: A Vision-Language-Action Flow Model for General Robot Control
vla
flow-matching
cross-embodiment
paligemma
action-expert
dexterous-manipulation
robot-foundation-model
action-chunking
openpi
2026年7月16日
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
vla
diffusion-policy
bimanual-manipulation
diffusion-transformer
imitation-learning
unified-action-space
action-chunking
aloha
2026年7月16日
Towards Generalist Robot Policies: What Matters in Building Vision-Language-Action Models
vla
empirical-study
backbone-ablation
policy-head
kosmos-2
paligemma
calvin
simplerenv
cross-embodiment
bytedance
2026年7月16日
RT-H: Action Hierarchies Using Language
rt-h
vla
action-hierarchy
language-motion
pali-x
correction
interactive-imitation-learning
robot-transformer
2026年7月16日
Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
benchmark
real2sim
manipulation
vla
policy-evaluation
sapien
maniskill
google-robot
widowx
bridge
2026年7月16日
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
vla
small-vlm
diffusion-policy
lora
data-efficient
low-latency
pythia
llava
real-robot
bimanual-manipulation
2026年7月16日
VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks
benchmark
vla
long-horizon-reasoning
mujoco
simulation
vlm-evaluation
language-conditioned-manipulation
common-sense
dataset
generalization
2026年7月16日
GR-3 Technical Report
vla
mixture-of-transformers
flow-matching
action-diffusion-transformer
qwen2.5-vl
vision-language-co-training
bimanual-manipulation
mobile-manipulation
vr-teleoperation
bytemini
long-horizon-manipulation
2026年7月16日
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
vla
mixture-of-experts
embodied-reasoning
reasoning-following
qwen2-vl
dexvla
open-world-generalization
bimanual-manipulation
2026年7月16日
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
vla
mixture-of-experts
catastrophic-forgetting
spurious-forgetting
task-interference
phased-training
qwen2-vl
diffusion-policy-head
multimodal-understanding
dual-arm-manipulation
Params
2026年7月16日
DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control
vla
diffusion-policy
cross-embodiment
curriculum-learning
qwen2-vl
action-expert
dexterous-manipulation
long-horizon
sub-step-reasoning
corl2025
2026年7月16日
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
vla
diffusion-transformer
in-context-conditioning
cross-embodiment
open-x-embodiment
action-chunking
dinov2
q-former
libero
calvin
maniskill2
simplerenv
2026年7月16日
DYNA-1: A Commercial-Grade Autonomous Dexterous Model
vla
reward-model
dexterous-manipulation
autonomous-deployment
napkin-folding
laundry-folding
commercial-robotics
self-recovery
zero-shot-generalization
2026年7月16日
A Survey on Efficient Vision-Language-Action Models
survey
vla
efficient-vla
model-compression
quantization
token-pruning
mixture-of-experts
action-tokenization
data-collection
reinforcement-learning
2026年7月16日
Helix: A Vision-Language-Action Model for Generalist Humanoid Control
vla
humanoid
dual-system
system1-system2
whole-body-control
teleoperation
onboard-inference
multi-robot
2026年7月16日
Galaxea Open-World Dataset and G0 Dual-System VLA Model
vla
dual-system
mobile-manipulation
whole-body-control
flow-matching
fast-tokenizer
paligemma
qwen2.5-vl
open-world-dataset
cross-embodiment-pretraining
2026年7月16日
Gemini Robotics 1.5 and Gemini Robotics-ER 1.5
vla
embodied-reasoning
agentic-robotics
cross-embodiment
motion-transfer
thinking-vla
gemini
humanoid
2026年7月16日
Gemini Robotics: Bringing AI into the Physical World
vla
embodied-reasoning
gemini-2.0
aloha-2
cross-embodiment
dexterous-manipulation
action-chunking
humanoid
safety-constitution
2026年7月16日
GenManip: LLM-driven Simulation for Generalizable Instruction-Following Manipulation
benchmark
isaac-sim
scene-graph
llm-task-generation
tabletop-manipulation
modular-vlm-agent
vla
behavior-cloning
cvpr2025
2026年7月16日
GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data
vla
grasping
synthetic-data
sim-to-real
flow-matching
chain-of-thought
open-vocabulary
action-expert
corl2025
2026年7月16日
GR00T N1.5: An Improved Open Foundation Model for Generalist Humanoid Robots
vla
humanoid
frozen-vlm
flow-matching
diffusion-transformer
flare
world-model-objective
cross-embodiment
dreamgen
eagle-2.5
2026年7月16日
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
vla
humanoid
dual-system
flow-matching
diffusion-transformer
cross-embodiment
latent-action
world-model
data-pyramid
eagle-2
2026年7月16日
Hume: Introducing System-2 Thinking in Visual-Language-Action Model
vla
dual-system
value-guided-thinking
flow-matching
offline-rl
cal-ql
cascaded-denoising
best-of-n
pi0
dexterous-manipulation
2026年7月16日
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
vla
dual-system
spatial-grounding
spatial-prompting
qwen2.5-vl
diffusion-policy
dit-action-head
genmanip
cross-embodiment
long-horizon-reasoning
2026年7月16日
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
survey
vla
vision-language-action
robotic-manipulation
taxonomy
monolithic-models
hierarchical-models
world-models
reinforcement-learning
embodied-ai
2026年7月16日
LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction
humanoid
whole-body-control
vla
latent-action
cvae
system1-system2
sim2real
unitree-g1
isaacsim
dagger
2026年7月16日
Magma: A Foundation Model for Multimodal AI Agents
vla
foundation-model
ui-navigation
robot-manipulation
set-of-mark
trace-of-mark
cross-embodiment
video-pretraining
cvpr2025
2026年7月16日
MolmoAct: Action Reasoning Models that can Reason in Space
vla
action-reasoning-model
depth-tokens
visual-trace
steerability
chain-of-thought
open-source
molmo
libero
simplerenv
2026年7月16日
1X NEO + Redwood AI (learned world-model policy)
humanoid
home-robot
vla
world-model
diffusion-policy
whole-body-control
inverse-dynamics-model
video-generation
reinforcement-learning
consumer-robotics
2026年7月16日
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
vla
dual-system
system1-system2
llava
prompt-tuning
calvin
open-source
empirical-study
survey
cross-attention
2026年7月16日
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
vla
fine-tuning
parallel-decoding
action-chunking
l1-regression
continuous-actions
film
libero
aloha
openvla
2026年7月16日
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
vla
knowledge-insulation
stop-gradient
flow-matching
fast-tokenizer
co-training
paligemma
action-expert
catastrophic-forgetting
2026年7月16日
π*0.6: a VLA That Learns From Experience (RECAP)
vla
reinforcement-learning
offline-rl
advantage-conditioning
flow-matching
robot-learning
dagger
value-function
2026年7月16日
π0.5: a VLA Model with Open-World Generalization
vla
mobile-manipulation
co-training
cross-embodiment
flow-matching
fast-tokenizer
hierarchical-policy
open-world-generalization
paligemma
2026年7月16日
FAST: Efficient Action Tokenization for Vision-Language-Action Models
vla
action-tokenization
discrete-cosine-transform
byte-pair-encoding
autoregressive-vla
pi0
openvla
droid
cross-embodiment
openpi
2026年7月16日
RoboBrain 2.0 Technical Report
vla
embodied-reasoning
spatial-reasoning
temporal-reasoning
multi-robot-planning
vision-language-model
qwen2.5-vl
grpo
flagscale
chain-of-thought
2026年7月16日
RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
vla
mllm
embodied-brain
task-planning
affordance-perception
trajectory-prediction
sharerobot
lora
open-x-embodiment
cvpr2025
2026年7月16日
RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation
benchmark
long-horizon-manipulation
vla
system1-system2
hierarchical-planning
libero
openvla
vlm-planner
neurips-2025
2026年7月16日
RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
vla
video-generative-pretraining
action-vae
chameleon-backbone
autoregressive-transformer
ego-centric-video
robot-manipulation
alibaba
2026年7月16日
RynnVLA-002: A Unified Vision-Language-Action and World Model
vla
world-model
chameleon
unified-tokenization
action-transformer
action-chunking
libero
lerobot
so100
alibaba
2026年7月16日
Skild Brain: An Omni-Bodied Robotic Foundation Model
vla
omni-bodied
cross-embodiment
hierarchical-policy
locomotion
in-context-learning
sim-to-real
learning-from-video
humanoid
quadruped
2026年7月16日
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
vla
flow-matching
community-datasets
lerobot
asynchronous-inference
low-cost-robotics
smolvlm
action-chunking
2026年7月16日
SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control
humanoid
whole-body-control
motion-tracking
motion-imitation
scaling
cross-embodiment
universal-token
fsq
teleoperation
vla
unitree-g1
sim-to-real
2026年7月16日
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
vla
spatial-representation
egocentric-3d
action-tokenization
cross-embodiment
paligemma2
zoedepth
simplerenv
libero
rss2025
2026年7月16日
Survey on Vision-Language-Action Models
survey
vla
ai-generated-content
arxiv-withdrawn
hallucination
academic-integrity
llm-authorship
embodied-ai
negative-example
2026年7月16日
TrackVLA: Embodied Visual Tracking in the Wild
vla
embodied-visual-tracking
diffusion-action-head
vicuna-7b
eva-clip
evt-bench
habitat-simulator
human-following
quadruped-robot
sim-to-real
2026年7月16日
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
embodied-visual-tracking
vla
chain-of-thought
polar-coordinate
target-memory
navfom
multi-camera
sim-to-real
2026年7月16日
Universal Actions for Enhanced Embodied Foundation Models
vla
universal-action-space
vector-quantization
codebook
cross-embodiment
heterogeneous-decoding
latent-action
open-x-embodiment
libero
fast-adaptation
2026年7月16日
UniVLA: Learning to Act Anywhere with Task-centric Latent Actions
vla
latent-action
vq-vae
cross-embodiment
dinov2
prismatic-vlm
navigation
manipulation
human-video
libero
calvin
r2r
rss-2025
2026年7月16日
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
vla
latent-action
imitation-learning
flow-matching
paligemma
cross-embodiment
simpler
libero
dexterous-hand
2026年7月16日
WALL-OSS: Igniting VLMs toward the Embodied Space
vla
mixture-of-experts
unified-cross-level-cot
flow-matching
fast-tokenization
qwen2.5-vl
embodied-vqa
static-router
long-horizon-manipulation
x-square-robot
2026年7月16日
WholeBodyVLA: Towards Unified Latent VLA for Whole-body Loco-manipulation Control
vla
humanoid
loco-manipulation
latent-action-model
vq-vae
reinforcement-learning
whole-body-control
agibot-x2
prismatic-vlm
iclr-2026
2026年7月16日
WorldVLA: Towards Autoregressive Action World Model
vla
world-model
chameleon
autoregressive-transformer
unified-tokenization
discrete-action-tokens
attention-mask
libero
alibaba
2026年7月16日
Galaxea G0.5 Technical Report
vla
autoregressive
action-tokenizer
chain-of-thought
cross-embodiment
visual-memory
qwen3.5
residual-vq
r1-lite
r1-pro
2026年7月16日
InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
vla
mixture-of-transformers
latent-foresight
world-model
flow-matching
qwen3.5
gated-deltanet
wan2.2
compositional-generalization
fast-tokenizer
2026年7月16日
InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation
vla
mixture-of-transformers
world-model
visual-foresight
flow-matching
cosmos-tokenizer
internvl3
qwen3-vl
sim-to-real
robotwin
2026年7月16日
π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
vla
robot-foundation-model
flow-matching
cross-embodiment
world-model
subgoal-image
compositional-generalization
gemma3
bagel
2026年7月16日
Ψ₀: An Open Foundation Model Towards Universal Humanoid Loco-Manipulation
vla
humanoid
egocentric-video
flow-matching
mm-dit
real-time-chunking
teleoperation
foundation-model
unitree-g1
action-chunking
2026年7月16日
RoboBrain 2.5: Depth in Sight, Time in Mind
vla
embodied-reasoning
3d-spatial-reasoning
depth-aware-grounding
spatial-trace-generation
dense-temporal-value-estimation
process-reward-model
qwen3-vl
flagscale
cross-accelerator-training
2026年7月16日
Wall-OSS-0.5 Technical Report: Pretrain Once, Act Anywhere
vla
mixture-of-transformers
rvq-action-tokenizer
flow-matching
gradient-bridged-co-training
qwen2.5-vl
cross-embodiment
muon-optimizer
zero-shot-manipulation
x-square-robot
2026年7月16日
足式运动与导航族(RMA · Parkour · ViNT/NoMaD · 导航基础模型)
deep-dive
locomotion-nav
legged-locomotion
sim-to-real
teacher-student
privileged-learning
parkour
visual-navigation
foundation-model
image-goal
vln
vla
cross-embodiment
2026年7月16日
VLA 谱系(RT-1→RT-2→OpenVLA→Octo→π0→GR00T→Gemini Robotics)
vla
vision-language-action
generalist-policy
action-head
flow-matching
diffusion-policy
dual-system
cross-embodiment
autoregressive-action
world-model
deep-dive
2026年7月16日
具身智能架构演进(VLA 骨干 · 动作头 · 扩散策略 · 人形全身控制)
embodied
architecture
vla
action-head
diffusion-policy
flow-matching
action-chunking
dual-system
humanoid
whole-body-control
cross-embodiment
survey
2026年7月16日
具身智能范式对比(VLA · 扩散策略 · 人形全身控制 · 足式运动/导航)
embodied
paradigms
vla
diffusion-policy
3d-policy
humanoid
whole-body-control
locomotion
navigation
cross-embodiment
foundation-policy
2026年7月16日
3D-VLA: A 3D Vision-Language-Action Generative World Model
world-model
vla
3d-llm
embodied-diffusion
point-cloud-generation
goal-image-generation
interaction-tokens
action-planning
icml2024
2026年7月16日
SIMA 2: A Generalist Embodied Agent for Virtual Worlds
embodied-agent
vla
generalist-agent
gemini
self-improvement
world-model
genie-3
rlvr
keyboard-mouse
3d-games
2026年7月16日
Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
world-model
robotic-manipulation
video-diffusion
vla
flow-matching
dual-arm
cross-embodiment
neural-simulator
benchmark
2026年7月16日
JEPA-VLA: Video Predictive Embedding is Needed for VLA Models
jepa
vla
world-model
v-jepa-2
visual-representation
policy-prior
gated-cross-attention
libero
robotwin
cortexbench
2026年7月16日
Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
world-model
robot-policy
video-diffusion-model
visuomotor-control
model-based-planning
diffusion-transformer
cosmos
vla
imitation-learning