AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: cross-embodiment
此标签下有64条笔记。
2026年7月16日
RoboNet: Large-Scale Multi-Robot Learning
dataset
cross-embodiment
multi-robot
video-prediction
visual-foresight
inverse-model
robot-learning
transfer-learning
2026年7月16日
GNM: A General Navigation Model to Drive Any Robot
visual-navigation
cross-embodiment
image-goal
omnipolicy
topological-graph
imitation-learning
waypoint
mobilenetv2
2026年7月16日
Real-World Robot Learning with Masked Visual Pre-training
visual-pretraining
masked-autoencoder
vit
frozen-features
behavior-cloning
egocentric-video
real-world-robots
cross-embodiment
scaling
2026年7月16日
Any-point Trajectory Modeling for Policy Learning
any-point-tracking
trajectory-model
video-pretraining
track-guided-policy
libero
cross-embodiment
imitation-learning
subgoal-representation
cotracker
2026年7月16日
NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration
visual-navigation
diffusion-policy
goal-masking
exploration
topological-graph
vint
cross-embodiment
mobile-robot
action-diffusion
edge-deployment
2026年7月16日
Open X-Embodiment: Robotic Learning Datasets and RT-X Models
cross-embodiment
robot-dataset
rt-x
rt-1-x
rt-2-x
vla
rlds
imitation-learning
positive-transfer
generalist-policy
2026年7月16日
RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot
dataset
robot-manipulation
teleoperation-data
contact-rich
multi-modal
force-torque
tactile-sensing
one-shot-imitation
cross-embodiment
2026年7月16日
RoboCat: A Self-Improving Foundation Agent for Robotic Manipulation
robocat
self-improvement
goal-conditioned
gato
vq-gan
decision-transformer
multi-embodiment
cross-embodiment
hindsight-goals
foundation-agent
manipulation
2026年7月16日
RoboVQA: Multimodal Long-Horizon Reasoning for Robotics
robovqa
benchmark
vqa
long-horizon-planning
cross-embodiment
intervention-rate
video-language-model
videococa
chain-of-thought
data-collection
2026年7月16日
ViNT: A Foundation Model for Visual Navigation
visual-navigation
foundation-model
image-goal
cross-embodiment
transformer
efficientnet
topological-graph
diffusion-subgoal
prompt-tuning
mobile-robot
2026年7月16日
All Robots in One: A New Standard and Unified Dataset for Versatile, General-Purpose Embodied Agents
cross-embodiment
robot-manipulation
teleoperation-dataset
data-standard
multi-modal
tactile-sensing
audio-sensing
object-navigation
sim-to-real
china
2026年7月16日
CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos
urban-navigation
point-goal-navigation
imitation-learning
visual-odometry
web-scale-video
dinov2
transformer
quadruped
data-scaling
cross-embodiment
2026年7月16日
Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation
cross-embodiment
transformer-policy
imitation-learning
action-chunking
quadruped-locomotion
visual-navigation
bimanual-manipulation
open-x-embodiment
generalist-robot-policy
2026年7月16日
EgoMimic: Scaling Imitation Learning via Egocentric Video
imitation-learning
egocentric-video
project-aria
human-video-data
cross-embodiment
teleoperation-alternative
action-chunking
act
bimanual-manipulation
domain-alignment
2026年7月16日
General Flow as Foundation Affordance for Scalable Robot Learning
3d-flow
affordance
human-video-learning
zero-shot-transfer
cross-embodiment
pointnext
point-cloud
scale-aware
keypoint-tracking
cotracker
2026年7月16日
HPT: Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers
embodied-ai
robot-learning
cross-embodiment
policy-pretraining
transformer
scaling-laws
proprioception
behavior-cloning
2026年7月16日
Flow as the Cross-Domain Manipulation Interface
object-flow
cross-embodiment
cross-domain
sim-to-real
human-video-learning
flow-conditioned-policy
animatediff
diffusion-policy
tapir
play-data
2026年7月16日
Latent Action Pretraining from Videos (LAPA)
vla
latent-action
vq-vae
video-pretraining
unsupervised
cross-embodiment
openvla
iclr-2025
2026年7月16日
LeLaN: Learning A Language-Conditioned Navigation Policy from In-the-Wild Videos
language-conditioned-navigation
object-navigation
last-mile-navigation
in-the-wild-video
youtube-data
foundation-model-distillation
cross-embodiment
edge-inference
video-auto-labeling
2026年7月16日
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
latent-action
video-pretraining
vq-vae
autoregressive-transformer
action-chunking
cross-embodiment
human-video-pretraining
calvin
simpler
co-fine-tuning
2026年7月16日
Octo: An Open-Source Generalist Robot Policy
generalist-robot-policy
cross-embodiment
diffusion-policy
transformer-policy
open-x-embodiment
action-chunking
goal-conditioning
imitation-learning
manipulation
open-source
2026年7月16日
π0: A Vision-Language-Action Flow Model for General Robot Control
vla
flow-matching
cross-embodiment
paligemma
action-expert
dexterous-manipulation
robot-foundation-model
action-chunking
openpi
2026年7月16日
RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation
robot-manipulation
teleoperation-dataset
multi-embodiment
humanoid-dexterous-hand
failure-data
digital-twin
isaac-sim
vla-benchmark
cross-embodiment
rss-2025
2026年7月16日
Towards Generalist Robot Policies: What Matters in Building Vision-Language-Action Models
vla
empirical-study
backbone-ablation
policy-head
kosmos-2
paligemma
calvin
simplerenv
cross-embodiment
bytedance
2026年7月16日
Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation
point-tracking
web-video-manipulation-learning
zero-shot-manipulation
embodiment-agnostic-representation
diffusion-transformer
residual-policy
cotracker
rigid-transform-estimation
cross-embodiment
robot-learning
2026年7月16日
UMI on Legs: Making Manipulation Policies Mobile with Manipulation-Centric Whole-body Controllers
quadruped-manipulation
whole-body-control
umi
diffusion-policy
cross-embodiment
sim2real
reinforcement-learning
end-effector-trajectory
task-frame-tracking
corl-2024
2026年7月16日
Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
data-collection
handheld-gripper
umi
in-the-wild
cross-embodiment
latency-matching
diffusion-policy
slam
gopro
rss-2024
2026年7月16日
ACE-F: A Cross Embodiment Foldable System with Force Feedback for Dexterous Teleoperation
teleoperation
cross-embodiment
force-feedback
sensorless-haptics
foldable-hardware
inverse-kinematics
dexterous-manipulation
imitation-learning
robosuite
UC-San-Diego
2026年7月16日
DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control
vla
diffusion-policy
cross-embodiment
curriculum-learning
qwen2-vl
action-expert
dexterous-manipulation
long-horizon
sub-step-reasoning
corl2025
2026年7月16日
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
vla
diffusion-transformer
in-context-conditioning
cross-embodiment
open-x-embodiment
action-chunking
dinov2
q-former
libero
calvin
maniskill2
simplerenv
2026年7月16日
DreamGen: Unlocking Generalization in Robot Learning through Video World Models
video-world-model
neural-trajectories
synthetic-data
pseudo-action-labeling
inverse-dynamics-model
latent-action-model
cross-embodiment
behavior-generalization
environment-generalization
groot-n1
2026年7月16日
Gemini Robotics 1.5 and Gemini Robotics-ER 1.5
vla
embodied-reasoning
agentic-robotics
cross-embodiment
motion-transfer
thinking-vla
gemini
humanoid
2026年7月16日
Gemini Robotics: Bringing AI into the Physical World
vla
embodied-reasoning
gemini-2.0
aloha-2
cross-embodiment
dexterous-manipulation
action-chunking
humanoid
safety-constitution
2026年7月16日
GR00T N1.5: An Improved Open Foundation Model for Generalist Humanoid Robots
vla
humanoid
frozen-vlm
flow-matching
diffusion-transformer
flare
world-model-objective
cross-embodiment
dreamgen
eagle-2.5
2026年7月16日
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
vla
humanoid
dual-system
flow-matching
diffusion-transformer
cross-embodiment
latent-action
world-model
data-pyramid
eagle-2
2026年7月16日
Humanoid Policy ~ Human Policy
egocentric-human-data
cross-embodiment
humanoid-manipulation
imitation-learning
action-chunking-transformer
VR-teleoperation
dexterous-manipulation
manipulation-dataset
2026年7月16日
In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data
egocentric-manipulation
human-data
humanoid
flow-matching
domain-adaptation
cross-embodiment
dataset
few-shot-learning
language-following
data-mixture
2026年7月16日
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
vla
dual-system
spatial-grounding
spatial-prompting
qwen2.5-vl
diffusion-policy
dit-action-head
genmanip
cross-embodiment
long-horizon-reasoning
2026年7月16日
Magma: A Foundation Model for Multimodal AI Agents
vla
foundation-model
ui-navigation
robot-manipulation
set-of-mark
trace-of-mark
cross-embodiment
video-pretraining
cvpr2025
2026年7月16日
MV-UMI: A Scalable Multi-View Interface for Cross-Embodiment Learning
cross-embodiment
handheld-gripper
UMI
multi-view
teleoperation-free
SAM-2
inpainting
diffusion-policy
three-jaw-gripper
imitation-learning
2026年7月16日
π0.5: a VLA Model with Open-World Generalization
vla
mobile-manipulation
co-training
cross-embodiment
flow-matching
fast-tokenizer
hierarchical-policy
open-world-generalization
paligemma
2026年7月16日
FAST: Efficient Action Tokenization for Vision-Language-Action Models
vla
action-tokenization
discrete-cosine-transform
byte-pair-encoding
autoregressive-vla
pi0
openvla
droid
cross-embodiment
openpi
2026年7月16日
RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
benchmark
dual-arm-manipulation
bimanual-manipulation
domain-randomization
sim-to-real
mllm-code-generation
cross-embodiment
vla-training-data
2026年7月16日
RoboVerse: Towards a Unified Platform, Dataset and Benchmark for Scalable and Generalizable Robot Learning
simulation
metasim
cross-simulator
cross-embodiment
robot-learning-benchmark
imitation-learning
reinforcement-learning
world-model
sim-to-real
teleoperation
2026年7月16日
Skild Brain: An Omni-Bodied Robotic Foundation Model
vla
omni-bodied
cross-embodiment
hierarchical-policy
locomotion
in-context-learning
sim-to-real
learning-from-video
humanoid
quadruped
2026年7月16日
SkillBlender: Towards Versatile Humanoid Whole-Body Loco-Manipulation via Skill Blending
humanoid
whole-body-control
loco-manipulation
hierarchical-rl
skill-blending
goal-conditioned
cross-embodiment
benchmark
reward-hacking
isaac-gym
2026年7月16日
SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control
humanoid
whole-body-control
motion-tracking
motion-imitation
scaling
cross-embodiment
universal-token
fsq
teleoperation
vla
unitree-g1
sim-to-real
2026年7月16日
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
vla
spatial-representation
egocentric-3d
action-tokenization
cross-embodiment
paligemma2
zoedepth
simplerenv
libero
rss2025
2026年7月16日
Universal Actions for Enhanced Embodied Foundation Models
vla
universal-action-space
vector-quantization
codebook
cross-embodiment
heterogeneous-decoding
latent-action
open-x-embodiment
libero
fast-adaptation
2026年7月16日
UniVLA: Learning to Act Anywhere with Task-centric Latent Actions
vla
latent-action
vq-vae
cross-embodiment
dinov2
prismatic-vlm
navigation
manipulation
human-video
libero
calvin
r2r
rss-2025
2026年7月16日
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
vla
latent-action
imitation-learning
flow-matching
paligemma
cross-embodiment
simpler
libero
dexterous-hand
2026年7月16日
Galaxea G0.5 Technical Report
vla
autoregressive
action-tokenizer
chain-of-thought
cross-embodiment
visual-memory
qwen3.5
residual-vq
r1-lite
r1-pro
2026年7月16日
π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
vla
robot-foundation-model
flow-matching
cross-embodiment
world-model
subgoal-image
compositional-generalization
gemma3
bagel
2026年7月16日
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
zero-shot-navigation
training-free
agentic-navigation
VLN-CE
ObjectNav
EQA
Aerial-VLN
cross-embodiment
MLLM-agent
backtracking
2026年7月16日
Wall-OSS-0.5 Technical Report: Pretrain Once, Act Anywhere
vla
mixture-of-transformers
rvq-action-tokenizer
flow-matching
gradient-bridged-co-training
qwen2.5-vl
cross-embodiment
muon-optimizer
zero-shot-manipulation
x-square-robot
2026年7月16日
足式运动与导航族(RMA · Parkour · ViNT/NoMaD · 导航基础模型)
deep-dive
locomotion-nav
legged-locomotion
sim-to-real
teacher-student
privileged-learning
parkour
visual-navigation
foundation-model
image-goal
vln
vla
cross-embodiment
2026年7月16日
VLA 谱系(RT-1→RT-2→OpenVLA→Octo→π0→GR00T→Gemini Robotics)
vla
vision-language-action
generalist-policy
action-head
flow-matching
diffusion-policy
dual-system
cross-embodiment
autoregressive-action
world-model
deep-dive
2026年7月16日
具身智能架构演进(VLA 骨干 · 动作头 · 扩散策略 · 人形全身控制)
embodied
architecture
vla
action-head
diffusion-policy
flow-matching
action-chunking
dual-system
humanoid
whole-body-control
cross-embodiment
survey
2026年7月16日
具身智能数据(Open-X · DROID · 遥操 · 仿真 · 人类视频 · 配比)
embodied
data
teleoperation
open-x-embodiment
droid
simulation
human-video
cross-embodiment
data-scaling
2026年7月16日
具身智能范式对比(VLA · 扩散策略 · 人形全身控制 · 足式运动/导航)
embodied
paradigms
vla
diffusion-policy
3d-policy
humanoid
whole-body-control
locomotion
navigation
cross-embodiment
foundation-policy
2026年7月16日
Learning to Act from Actionless Videos through Dense Correspondences
world-model
video-diffusion
dense-correspondence
optical-flow
action-free-learning
inverse-kinematics
robot-manipulation
navigation
cross-embodiment
replanning
2026年7月16日
Navigation World Models
world-model
navigation
diffusion-transformer
CDiT
action-conditioning
video-prediction
MPC-planning
egocentric-video
robotics
cross-embodiment
goals
context
2026年7月16日
Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
world-model
robotic-manipulation
video-diffusion
vla
flow-matching
dual-arm
cross-embodiment
neural-simulator
benchmark
2026年7月16日
Vidar: Embodied Video Diffusion Model for Generalist Manipulation
world-model
video-diffusion
robot-manipulation
bimanual-manipulation
inverse-dynamics
cross-embodiment
test-time-scaling
rectified-flow
aloha-robot