AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: vlm
此标签下有9条笔记。
2026年7月16日
Foundation Models in Robotics: Applications, Challenges, and the Future
survey
foundation-models
robotics
vlm
llm
robot-transformers
vla
embodied-ai
uncertainty-quantification
safety
2026年7月16日
ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation
manipulation
keypoint-constraints
vlm
gpt-4o
dinov2
constrained-optimization
training-free
closed-loop
bimanual
code-as-policy
2026年7月16日
Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning
physical-ai
vlm
embodied-reasoning
chain-of-thought
grpo
reinforcement-learning
ontology
benchmark
cosmos
robotics
2026年7月16日
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
vlm
benchmark
physical-reasoning
embodied-ai
intuitive-physics
robotic-manipulation
iclr2025
multimodal
2026年6月25日
Emu3: Next-Token Prediction is All You Need
unified
autoregressive
next-token-prediction
discrete-token
vision-tokenizer
t2i
t2v
vlm
movqgan
dpo
2026年6月25日
JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation
unified
multimodal
rectified-flow
autoregression
llm
t2i
vlm
deepseek
2026年6月25日
VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation
unified
autoregressive
next-token
visual-tokenizer
rq-vae
clip-alignment
vlm
image-generation
video-generation
2026年6月25日
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
unified-multimodal
autoregressive
decoupled-visual-encoding
t2i
vlm
open-source
deepseek
2026年6月25日
SeedEdit 3.0: Fast and High-Quality Generative Image Editing
image-editing
instruction-editing
diffusion
vlm
reward-model
rectified-flow
distillation
bytedance