Enregistré dans:
| Auteurs principaux: | Li, Qiuhao, Yuan, Shenghai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2402.05747 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025)
par: Yuan, Shenghai, et autres
Publié: (2025)
GERA: Geometric Embedding for Efficient Point Registration Analysis
par: Li, Geng, et autres
Publié: (2024)
par: Li, Geng, et autres
Publié: (2024)
WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model
par: Li, Zongjian, et autres
Publié: (2024)
par: Li, Zongjian, et autres
Publié: (2024)
MMAUD: A Comprehensive Multi-Modal Anti-UAV Dataset for Modern Miniature Drone Threats
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
VITAL: Interactive Few-Shot Imitation Learning via Visual Human-in-the-Loop Corrections
par: Kasaei, Hamidreza, et autres
Publié: (2024)
par: Kasaei, Hamidreza, et autres
Publié: (2024)
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
par: Lin, Bin, et autres
Publié: (2025)
par: Lin, Bin, et autres
Publié: (2025)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
par: Shen, Boyang, et autres
Publié: (2026)
par: Shen, Boyang, et autres
Publié: (2026)
Towards Efficient and Intelligent Laser Weeding: Method and Dataset for Weed Stem Detection
par: Liu, Dingning, et autres
Publié: (2025)
par: Liu, Dingning, et autres
Publié: (2025)
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
par: Liu, Chenyv, et autres
Publié: (2026)
par: Liu, Chenyv, et autres
Publié: (2026)
WAS: Dataset and Methods for Artistic Text Segmentation
par: Xie, Xudong, et autres
Publié: (2024)
par: Xie, Xudong, et autres
Publié: (2024)
Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy
par: Wu, Pengyuan, et autres
Publié: (2026)
par: Wu, Pengyuan, et autres
Publié: (2026)
Comp-Attn: Present-and-Align Attention for Compositional Video Generation
par: Zhang, Hongyu, et autres
Publié: (2025)
par: Zhang, Hongyu, et autres
Publié: (2025)
InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement
par: Zou, Yude, et autres
Publié: (2026)
par: Zou, Yude, et autres
Publié: (2026)
PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation
par: Xue, Qiyao, et autres
Publié: (2024)
par: Xue, Qiyao, et autres
Publié: (2024)
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
par: Lee, Daeun, et autres
Publié: (2024)
par: Lee, Daeun, et autres
Publié: (2024)
Risk-Aware Human-in-the-Loop Framework with Adaptive Intrusion Response for Autonomous Vehicles
par: Wasif, Dawood, et autres
Publié: (2026)
par: Wasif, Dawood, et autres
Publié: (2026)
HuLP: Human-in-the-Loop for Prognosis
par: Ridzuan, Muhammad, et autres
Publié: (2024)
par: Ridzuan, Muhammad, et autres
Publié: (2024)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
par: Jiang, Siyang, et autres
Publié: (2025)
par: Jiang, Siyang, et autres
Publié: (2025)
MagicMan: Generative Novel View Synthesis of Humans with 3D-Aware Diffusion and Iterative Refinement
par: He, Xu, et autres
Publié: (2024)
par: He, Xu, et autres
Publié: (2024)
Stitch and Tell: A Structured Multimodal Data Augmentation Method for Spatial Understanding
par: Yin, Hang, et autres
Publié: (2025)
par: Yin, Hang, et autres
Publié: (2025)
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
par: Wang, Zun, et autres
Publié: (2024)
par: Wang, Zun, et autres
Publié: (2024)
Refined Temporal Pyramidal Compression-and-Amplification Transformer for 3D Human Pose Estimation
par: Liu, Hanbing, et autres
Publié: (2023)
par: Liu, Hanbing, et autres
Publié: (2023)
Human Activity Recognition using RGB-Event based Sensors: A Multi-modal Heat Conduction Model and A Benchmark Dataset
par: Wang, Shiao, et autres
Publié: (2025)
par: Wang, Shiao, et autres
Publié: (2025)
Self-Correcting Self-Consuming Loops for Generative Model Training
par: Gillman, Nate, et autres
Publié: (2024)
par: Gillman, Nate, et autres
Publié: (2024)
PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment
par: Lee, Suhyeon, et autres
Publié: (2025)
par: Lee, Suhyeon, et autres
Publié: (2025)
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
par: Deng, Yufan, et autres
Publié: (2025)
par: Deng, Yufan, et autres
Publié: (2025)
Just Add Geometry: Gradient-Free Open-Vocabulary 3D Detection Without Human-in-the-Loop
par: Goel, Atharv, et autres
Publié: (2025)
par: Goel, Atharv, et autres
Publié: (2025)
Sketch Input Method Editor: A Comprehensive Dataset and Methodology for Systematic Input Recognition
par: Zhu, Guangming, et autres
Publié: (2023)
par: Zhu, Guangming, et autres
Publié: (2023)
A Comprehensive Survey on Human Video Generation: Challenges, Methods, and Insights
par: Lei, Wentao, et autres
Publié: (2024)
par: Lei, Wentao, et autres
Publié: (2024)
PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion
par: Choi, Jaehyun, et autres
Publié: (2025)
par: Choi, Jaehyun, et autres
Publié: (2025)
3D Weakly Supervised Semantic Segmentation via Class-Aware and Geometry-Guided Pseudo-Label Refinement
par: Xu, Xiaoxu, et autres
Publié: (2025)
par: Xu, Xiaoxu, et autres
Publié: (2025)
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
par: Deng, Yufan, et autres
Publié: (2025)
par: Deng, Yufan, et autres
Publié: (2025)
Architecture, Dataset and Model-Scale Agnostic Data-free Meta-Learning
par: Hu, Zixuan, et autres
Publié: (2023)
par: Hu, Zixuan, et autres
Publié: (2023)
RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding
par: Xu, Linrui, et autres
Publié: (2024)
par: Xu, Linrui, et autres
Publié: (2024)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
par: Zhang, Yulong
Publié: (2025)
par: Zhang, Yulong
Publié: (2025)
A Comprehensive Dataset for Human vs. AI Generated Image Detection
par: Roy, Rajarshi, et autres
Publié: (2026)
par: Roy, Rajarshi, et autres
Publié: (2026)
Longitudinal Vestibular Schwannoma Dataset with Consensus-based Human-in-the-loop Annotations
par: Wijethilake, Navodini, et autres
Publié: (2025)
par: Wijethilake, Navodini, et autres
Publié: (2025)
QNCD: Quantization Noise Correction for Diffusion Models
par: Chu, Huanpeng, et autres
Publié: (2024)
par: Chu, Huanpeng, et autres
Publié: (2024)
Bridging Synthetic and Real-World Domains: A Human-in-the-Loop Weakly-Supervised Framework for Industrial Toxic Emission Segmentation
par: Tao, Yida, et autres
Publié: (2025)
par: Tao, Yida, et autres
Publié: (2025)
AdCorDA: Classifier Refinement via Adversarial Correction and Domain Adaptation
par: Shen, Lulan, et autres
Publié: (2024)
par: Shen, Lulan, et autres
Publié: (2024)
Documents similaires
-
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025) -
GERA: Geometric Embedding for Efficient Point Registration Analysis
par: Li, Geng, et autres
Publié: (2024) -
WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model
par: Li, Zongjian, et autres
Publié: (2024) -
MMAUD: A Comprehensive Multi-Modal Anti-UAV Dataset for Modern Miniature Drone Threats
par: Yuan, Shenghai, et autres
Publié: (2024) -
VITAL: Interactive Few-Shot Imitation Learning via Visual Human-in-the-Loop Corrections
par: Kasaei, Hamidreza, et autres
Publié: (2024)