AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: open-source
此标签下有51条笔记。
2026年7月16日
MuJoCo: A Physics Engine for Model-Based Control
physics-engine
contact-dynamics
generalized-coordinates
convex-solver
inverse-dynamics
mjcf
model-based-control
trajectory-optimization
rl-simulation
open-source
2026年7月16日
Genesis: A Generative and Universal Physics Engine for Robotics and Embodied AI
physics-engine
robot-simulation
differentiable-simulation
generative-simulation
gpu-acceleration
multi-physics
ray-tracing
embodied-ai
taichi
open-source
2026年7月16日
Octo: An Open-Source Generalist Robot Policy
generalist-robot-policy
cross-embodiment
diffusion-policy
transformer-policy
open-x-embodiment
action-chunking
goal-conditioning
imitation-learning
manipulation
open-source
2026年7月16日
OpenVLA: An Open-Source Vision-Language-Action Model
vla
open-source
open-x-embodiment
prismatic-vlm
llama-2
action-tokenization
lora
quantization
generalist-manipulation
robot-learning
2026年7月16日
MolmoAct: Action Reasoning Models that can Reason in Space
vla
action-reasoning-model
depth-tokens
visual-trace
steerability
chain-of-thought
open-source
molmo
libero
simplerenv
2026年7月16日
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
vla
dual-system
system1-system2
llava
prompt-tuning
calvin
open-source
empirical-study
survey
cross-attention
2026年7月16日
HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels
world-model
3d-generation
panorama
diffusion-transformer
mesh-export
scene-layering
gaussian-splatting
text-to-3d
image-to-3d
open-source
2026年7月16日
Matrix-Game: Interactive World Foundation Model
world-model
game-generation
minecraft
interactive
image-to-world
diffusion-transformer
action-control
benchmark
open-source
2026年7月16日
Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition
world-model
game-generation
interactive-video
camera-control
action-conditioning
autoregressive
diffusion-transformer
distillation
aaa-games
open-source
2026年7月16日
Yume: An Interactive World Generation Model
world-model
video-diffusion
image-to-video
camera-control
keyboard-control
masked-diffusion-transformer
diffusion-acceleration
sekai
open-source
2026年7月16日
AlayaWorld: Long-Horizon and Playable Video World Generation
world-model
interactive-video
autoregressive-dit
camera-control
3d-cache
long-horizon
real-time-generation
dmd-distillation
open-source
2026年6月25日
CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers
text-to-video
autoregressive
transformer
vqvae
cogview2
open-source
2026年6月25日
DeepFloyd IF
text-to-image
cascaded-diffusion
pixel-diffusion
t5-xxl
imagen-style
open-source
text-rendering
super-resolution
2026年6月25日
I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models
image-to-video
video-diffusion
cascaded-diffusion
vldm
ldm
sdedit
open-source
2026年6月25日
Kandinsky 2.x (Image Prior + Latent Diffusion)
t2i
unclip
image-prior
latent-diffusion
movq
multilingual
open-source
clip
2026年6月25日
LaVie: High-Quality Video Generation with Cascaded Latent Diffusion Models
t2v
video-diffusion
latent-diffusion
cascaded
temporal-attention
rope
joint-image-video
vimeo25m
open-source
2026年6月25日
ModelScopeT2V(ModelScope Text-to-Video Technical Report)
text-to-video
latent-diffusion
spatio-temporal
unet3d
open-source
webvid
vqgan
2026年6月25日
MusicGen / AudioCraft: Simple and Controllable Music Generation
music-generation
text-to-music
audio-lm
encodec
rvq
codebook-interleaving
autoregressive
transformer
open-source
2026年6月25日
PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
t2i
dit
diffusion-transformer
cross-attention
t5
low-cost-training
re-captioning
open-source
Params
Images
2026年6月25日
Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
video
image-to-video
text-to-video
latent-diffusion
data-curation
open-source
edm
multi-view
Clips
2026年6月25日
VideoCrafter1: Open Diffusion Models for High-Quality Video Generation
video
t2v
i2v
diffusion
lvdm
open-source
unet
2026年6月25日
Baichuan-Omni
omni
mllm
audio
video
image
speech
open-source
vita
siglip
whisper
conv-gmlp
2026年6月25日
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
text-to-video
diffusion-transformer
3d-vae
expert-adaln
dit
open-source
i2v
2026年6月25日
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
t2i
diffusion-transformer
dit
chinese
bilingual
multi-resolution
rope
recaptioning
mllm
open-source
2026年6月25日
HunyuanVideo: A Systematic Framework For Large Video Generative Models
video
t2v
dit
flow-matching
mmdit
3d-vae
open-source
scaling-law
2026年6月25日
Kolors(可图): Effective Training of Diffusion Model for Photorealistic Text-to-Image Synthesis
t2i
latent-diffusion
unet
sdxl
chatglm
bilingual
chinese-text-rendering
recaption
open-source
2026年6月25日
LTX-Video: Realtime Video Latent Diffusion
video
t2v
i2v
dit
latent-diffusion
rectified-flow
video-vae
realtime
open-source
2026年6月25日
Mochi 1 (preview)
text-to-video
diffusion-transformer
asymmdit
mmdit
3d-attention
flow-matching
open-source
apache-2.0
video-vae
2026年6月25日
Open-Sora Plan / Open-Sora(2024 开源复现 Sora)
video
t2v
i2v
dit
diffusion
sora-reproduction
open-source
wf-vae
skiparse-attention
rectified-flow
2026年6月25日
BAGEL: Emerging Properties in Unified Multimodal Pretraining
unified-multimodal
mot
mixture-of-transformers
rectified-flow
interleaved
world-modeling
image-editing
open-source
2026年6月25日
CogView4-6B
t2i
dit
mmdit
flow-matching
glm
bilingual
chinese-text-rendering
open-source
2026年6月25日
Emu3.5: Native Multimodal Models are World Learners
native-multimodal
autoregressive
next-token-prediction
world-model
interleaved
x2i
discrete-diffusion
open-source
2026年6月25日
HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
text-to-image
dit
mmdit
moe
sparse-moe
flow-matching
distillation
dmd
gan
open-source
2026年6月25日
Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material
image-to-3d
shape-generation
pbr-texture
flow-matching
dit
vae
multi-view-diffusion
open-source
tencent
2026年6月25日
HunyuanImage 2.1:高效的 2K 高分辨率文生图扩散模型
t2i
mmdit
diffusion-transformer
high-resolution
2k
distillation
meanflow
rlhf
text-rendering
byt5
vae
repa
open-source
2026年6月25日
HunyuanImage 3.0 Technical Report
t2i
unified-multimodal
autoregressive
moe
diffusion
transfusion
chain-of-thought
open-source
rlhf
2026年6月25日
HunyuanVideo 1.5
video-generation
dit
t2v
i2v
flow-matching
sparse-attention
sparse-attn
video-super-resolution
open-source
lightweight
muon
distillation
2026年6月25日
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
unified-multimodal
autoregressive
decoupled-visual-encoding
t2i
vlm
open-source
deepseek
2026年6月25日
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
video-generation
text-to-video
image-to-video
text-to-image
image-editing
latent-diffusion
flow-matching
dit
crossdit
nabla
sparse-attention
open-source
russian
2026年6月25日
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
discrete-diffusion
unified-multimodal
masked-generation
dllm
t2i
image-editing
image-understanding
self-grpo
open-source
2026年6月25日
Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
t2i
dit
flow-matching
unified-attention
gemma2
recaptioning
open-source
iccv2025
2026年6月25日
Ming-Omni / Ming-Lite-Omni: A Unified Multimodal Model for Perception and Generation
omni
moe
unified
any-to-any
speech
image-generation
video
gpt-4o-class
open-source
2026年6月25日
OmniGen2: Towards Instruction-Aligned Multimodal Generation
unified
multimodal-generation
t2i
image-editing
in-context
decoupled-decoding
omni-rope
grpo
rectified-flow
open-source
2026年6月25日
Ovis-U1: Unified Understanding, Generation and Editing
unified
mllm
t2i
edit
mmdit
flow-matching
qwen3
ovis
open-source
2026年6月25日
Qwen2.5-Omni Technical Report
omni
multimodal
any-to-any
speech
thinker-talker
tmrope
streaming
open-source
qwen
2026年6月25日
SkyReels-V2: Infinite-Length Film Generative Model
video
diffusion-forcing
autoregressive
flow-matching
dit
dpo
long-video
open-source
2026年6月25日
Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction
speech
audio-llm
voice-chat
tts
dual-codebook
rlhf
open-source
multimodal
2026年6月25日
Step1X-Edit: A Practical Framework for General Image Editing
image-editing
instruction-editing
mllm
dit
flux
qwen2.5-vl
rectified-flow
gedit-bench
open-source
2026年6月25日
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
unified
edit
perception
siglip
flux
qwen2.5-vl
flow-matching
open-source
2026年6月25日
Wan: Open and Advanced Large-Scale Video Generative Models (Wan 2.1)
video
t2v
i2v
dit
flow-matching
3d-vae
wan-vae
open-source
video-editing
vace
2026年6月25日
Wan 2.2
video-generation
t2v
i2v
ti2v
moe
diffusion-transformer
flow-matching
vae
open-source
cinematic