AI Research 技术调研
Search
搜索
暗色模式
亮色模式
探索
标签: controlnet
此标签下有25条笔记。
2026年7月16日
Generative Image as Action Models
manipulation
diffusion-model
controlnet
stable-diffusion
action-representation
act
behavior-cloning
rlbench
visuomotor
image-generation
2026年7月16日
MagicDrive: Street View Generation with Diverse 3D Geometry Control
world-model
autonomous-driving
diffusion
multi-view-generation
controlnet
bev
3d-bounding-box
nuscenes
data-augmentation
cross-view-attention
2026年7月16日
Panacea: Panoramic and Controllable Video Generation for Autonomous Driving
world-model
autonomous-driving
diffusion
multi-view-generation
video-generation
bev
controlnet
nuscenes
data-augmentation
4d-attention
2026年7月16日
WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation
world-model
autonomous-driving
diffusion
controlnet
multi-camera
video-generation
nuscenes
occupancy
hdmap
action-conditioning
2026年7月16日
AVID: Adapting Video Diffusion Models to World Models
world-model
video-diffusion
adapter
action-conditioning
frozen-backbone
product-of-experts
controlnet
procgen
rt1
dynamicrafter
2026年7月16日
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
world-model
autonomous-driving
diffusion
multi-view-generation
long-video-generation
bev
controlnet
nuscenes
failure-case-mining
uniad
data-augmentation
2026年7月16日
MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control
world-model
autonomous-driving
diffusion-transformer
flow-matching
multi-view-generation
3d-vae
long-video-generation
controlnet
nuscenes
sequence-parallel
2026年7月16日
Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models
world-model
autonomous-driving
synthetic-data
controlnet
multi-view
lidar-generation
diffusion
dit
cosmos
data-flywheel
2026年7月16日
World Simulation with Video Foundation Models for Physical AI (Cosmos-Predict2.5 & Cosmos-Transfer2.5)
world-model
physical-ai
video-foundation-model
flow-matching
controlnet
robotics
autonomous-driving
sim2real
cosmos
2026年7月16日
Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
world-model
diffusion
dit
controlnet
multimodal-control
sim2real
autonomous-driving
robotics
physical-ai
video-generation
2026年7月16日
Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
driving-world-model
synthetic-data
3d-asset-insertion
controlnet
dit
nuscenes
corner-case
data-augmentation
fair-evaluation
iclr2026
2026年7月16日
WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
world-model
autonomous-driving
gaussian-splatting
feed-forward-reconstruction
latent-diffusion
controlnet
novel-view-synthesis
4d-scene-generation
rectified-flow
iclr2026
2026年6月25日
IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models
image-prompt
adapter
cross-attention
clip
ip-adapter
faceid
controlnet
stable-diffusion
2026年6月25日
MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model
human-animation
pose-driven
densepose
appearance-encoder
temporal-attention
video-diffusion
controlnet
sd15
2026年6月25日
Controlling Text-to-Image Diffusion by Orthogonal Finetuning (OFT / COFT)
finetuning
peft
subject-driven
controllable-generation
dreambooth
controlnet
orthogonal
hyperspherical-energy
stable-diffusion
2026年6月25日
Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation
video-to-video
zero-shot
stylization
diffusion
optical-flow
cross-frame-attention
ebsynth
controlnet
siggraph-asia
2026年6月25日
UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild
controllable-generation
controlnet
diffusion
multi-task
hypernet
moe
c2i
zero-shot
2026年6月25日
X-Adapter: Adding Universal Compatibility of Plugins for Upgraded Diffusion Model
adapter
plugin-compatibility
controlnet
lora
sdxl
sd15
training-free-plugin
feature-remapping
diffusion
2026年6月25日
Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model
3d
multi-view
novel-view-synthesis
diffusion
stable-diffusion
reference-attention
controlnet
objaverse
2026年6月25日
FLUX.1 Tools (Fill / Canny / Depth / Redux)
flux
inpainting
outpainting
controlnet
structural-conditioning
image-variation
mmdit
flow-matching
guidance-distillation
redux
siglip
2026年6月25日
OminiControl: Minimal and Universal Control for Diffusion Transformer
dit
flux
controlnet
subject-driven
image-conditioning
lora
rope
dataset
2026年6月25日
PixArt-δ: Fast and Controllable Image Generation with Latent Consistency Models
pixart
dit
lcm
consistency-distillation
controlnet
transformer
text-to-image
few-step
huawei
2026年6月25日
Recraft V3 (red_panda)
t2i
closed-source
text-rendering
layout-control
vector-graphics
controlnet
design
api
ocr
2026年6月25日
Qwen-Image-Edit / Qwen-Image-Edit-2509
image-editing
mmdit
flow-matching
text-rendering
dual-encoding
qwen2.5-vl
instruction-edit
controlnet
2026年6月25日
图像编辑与可控生成族横向对比:从 ControlNet/InstructPix2Pix 到 Kontext/Step1X/Qwen-Edit
image-editing
controllable-generation
controlnet
instruction-editing
personalization
inversion
attention-control
unified-editing
diffusion
flux
deep-dive