AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: Params
此标签下有6条笔记。
2026年7月16日
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
vla
mixture-of-experts
catastrophic-forgetting
spurious-forgetting
task-interference
phased-training
qwen2-vl
diffusion-policy-head
multimodal-understanding
dual-arm-manipulation
Params
2026年6月25日
All are Worth Words: A ViT Backbone for Diffusion Models (U-ViT)
diffusion
vit
backbone
transformer
long-skip-connection
latent-diffusion
t2i
class-conditional
Layers
Heads
Params
2026年6月25日
PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
t2i
dit
diffusion-transformer
cross-attention
t5
low-cost-training
re-captioning
open-source
Params
Images
2026年6月25日
Genie: Generative Interactive Environments
world-model
video
latent-action
unsupervised
maskgit
st-transformer
vq-vae
foundation-model
playable
agents
Params
2026年6月25日
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
autoregressive
visual-tokenizer
residual-diffusion
var
t2i
efficient-inference
1024px
Params
Step
2026年6月25日
PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation
t2i
dit
diffusion-transformer
4k
kv-compression
weak-to-strong
efficient
pixart
Params