AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: qwen2.5-vl
此标签下有10条笔记。
2026年7月16日
GR-3 Technical Report
vla
mixture-of-transformers
flow-matching
action-diffusion-transformer
qwen2.5-vl
vision-language-co-training
bimanual-manipulation
mobile-manipulation
vr-teleoperation
bytemini
long-horizon-manipulation
2026年7月16日
Galaxea Open-World Dataset and G0 Dual-System VLA Model
vla
dual-system
mobile-manipulation
whole-body-control
flow-matching
fast-tokenizer
paligemma
qwen2.5-vl
open-world-dataset
cross-embodiment-pretraining
2026年7月16日
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
vla
dual-system
spatial-grounding
spatial-prompting
qwen2.5-vl
diffusion-policy
dit-action-head
genmanip
cross-embodiment
long-horizon-reasoning
2026年7月16日
RoboBrain 2.0 Technical Report
vla
embodied-reasoning
spatial-reasoning
temporal-reasoning
multi-robot-planning
vision-language-model
qwen2.5-vl
grpo
flagscale
chain-of-thought
2026年7月16日
WALL-OSS: Igniting VLMs toward the Embodied Space
vla
mixture-of-experts
unified-cross-level-cot
flow-matching
fast-tokenization
qwen2.5-vl
embodied-vqa
static-router
long-horizon-manipulation
x-square-robot
2026年7月16日
Wall-OSS-0.5 Technical Report: Pretrain Once, Act Anywhere
vla
mixture-of-transformers
rvq-action-tokenizer
flow-matching
gradient-bridged-co-training
qwen2.5-vl
cross-embodiment
muon-optimizer
zero-shot-manipulation
x-square-robot
2026年7月16日
PAN: A World Model for General, Interactable, and Long-Horizon World Simulation
world-model
generative-latent-prediction
glp
autoregressive
video-diffusion
causal-swin-dpm
qwen2.5-vl
wan2.1
long-horizon
simulative-reasoning
2026年6月25日
Qwen-Image-Edit / Qwen-Image-Edit-2509
image-editing
mmdit
flow-matching
text-rendering
dual-encoding
qwen2.5-vl
instruction-edit
controlnet
2026年6月25日
Step1X-Edit: A Practical Framework for General Image Editing
image-editing
instruction-editing
mllm
dit
flux
qwen2.5-vl
rectified-flow
gedit-bench
open-source
2026年6月25日
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
unified
edit
perception
siglip
flux
qwen2.5-vl
flow-matching
open-source