AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: vae
此标签下有15条笔记。
2026年7月16日
World Models (Recurrent World Models Facilitate Policy Evolution)
world-model
model-based-rl
vae
mdn-rnn
rnn
cma-es
evolution-strategies
latent-imagination
foundational
2026年7月16日
DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model
world-model
autonomous-driving
occupancy-prediction
diffusion-transformer
vae
trajectory-conditioning
nuscenes
occ3d
4d-forecasting
2026年7月16日
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
tokenizer
visual-tokenization
image-video-joint
vqvae
vae
window-attention
causal-attention
progressive-training
autoregressive-transformer
latent-diffusion
2026年6月25日
High-Resolution Image Synthesis with Latent Diffusion Models (LDM)
latent-diffusion
ldm
vae
u-net
cross-attention
text-to-image
stable-diffusion
two-stage
2026年6月25日
Stable Audio: Fast Timing-Conditioned Latent Audio Diffusion
audio
music-generation
latent-diffusion
text-to-audio
timing-conditioning
stereo
vae
clap
2026年6月25日
Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model
unified
multimodal
diffusion
next-token
transformer
late-fusion
chameleon
vae
2026年6月25日
FLUX.2
flux
rectified-flow
mmdit
flow-matching
image-editing
multi-reference
vae
text-rendering
open-weights
2026年6月25日
Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material
image-to-3d
shape-generation
pbr-texture
flow-matching
dit
vae
multi-view-diffusion
open-source
tencent
2026年6月25日
HunyuanImage 2.1:高效的 2K 高分辨率文生图扩散模型
t2i
mmdit
diffusion-transformer
high-resolution
2k
distillation
meanflow
rlhf
text-rendering
byt5
vae
repa
open-source
2026年6月25日
Wan 2.2
video-generation
t2v
i2v
ti2v
moe
diffusion-transformer
flow-matching
vae
open-source
cinematic
2026年6月25日
Qwen-Image-2.0 Technical Report
qwen
mmdit
qwen3-vl
vae
rectified-flow
image-editing
text-rendering
rlhf
grpo
dmd-distillation
unified-generation
2026年6月25日
Qwen-Image-VAE-2.0 Technical Report
vae
high-compression
latent-diffusion
tokenizer
text-rendering
semantic-alignment
dit
image-generation
2026年6月25日
Seed3D 2.0: Advancing High-Fidelity Simulation-Ready 3D Content Generation
3d-generation
image-to-3d
pbr
vecset
rectified-flow
dit
moe
vae
articulation
scene-generation
simulation-ready
bytedance
2026年6月25日
模型架构演进:从 U-Net 扩散到统一 omni 骨干(2020–2026)
omni
architecture
diffusion
dit
mmdit
rectified-flow
autoregressive
visual-tokenizer
vae
text-encoder
unified-multimodal
survey
2026年6月25日
Infra:训练规模·并行·tokenizer 工程·推理加速
infra
parallelism
tokenizer
vae
distillation
quantization
scaling
omni-survey