Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yicheng, Li, Xiangtai, Li, Yining, Zeng, Yanhong, Wu, Jianzong, Zhao, Xiangyu, Chen, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MotionBooth: Motion-Aware Customized Text-to-Video Generation
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
An Open and Comprehensive Pipeline for Unified Object Grounding and Detection
par: Zhao, Xiangyu, et autres
Publié: (2024)
par: Zhao, Xiangyu, et autres
Publié: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
par: Zhao, Xiangyu, et autres
Publié: (2024)
par: Zhao, Xiangyu, et autres
Publié: (2024)
RTMO: Towards High-Performance One-Stage Real-Time Multi-Person Pose Estimation
par: Lu, Peng, et autres
Publié: (2023)
par: Lu, Peng, et autres
Publié: (2023)
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
par: Yuan, Haobo, et autres
Publié: (2024)
par: Yuan, Haobo, et autres
Publié: (2024)
DreamRelation: Bridging Customization and Relation Generation
par: Shi, Qingyu, et autres
Publié: (2024)
par: Shi, Qingyu, et autres
Publié: (2024)
OMG-Seg: Is One Model Good Enough For All Segmentation?
par: Li, Xiangtai, et autres
Publié: (2024)
par: Li, Xiangtai, et autres
Publié: (2024)
A Task is Worth One Word: Learning with Task Prompts for High-Quality Versatile Image Inpainting
par: Zhuang, Junhao, et autres
Publié: (2023)
par: Zhuang, Junhao, et autres
Publié: (2023)
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
par: Shi, Qingyu, et autres
Publié: (2025)
par: Shi, Qingyu, et autres
Publié: (2025)
EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model
par: Dong, Ruixiao, et autres
Publié: (2025)
par: Dong, Ruixiao, et autres
Publié: (2025)
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
par: Shi, Qingyu, et autres
Publié: (2025)
par: Shi, Qingyu, et autres
Publié: (2025)
Cherry Yield Forecast: Harvest Prediction for Individual Sweet Cherry Trees
par: Gilson, Andreas, et autres
Publié: (2025)
par: Gilson, Andreas, et autres
Publié: (2025)
ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling
par: Li, Daowen, et autres
Publié: (2026)
par: Li, Daowen, et autres
Publié: (2026)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024)
par: Fang, Xinyu, et autres
Publié: (2024)
Federated Domain Generalization with Domain-specific Soft Prompts Generation
par: Wu, Jianhan, et autres
Publié: (2025)
par: Wu, Jianhan, et autres
Publié: (2025)
FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
par: Feng, Haoran, et autres
Publié: (2025)
par: Feng, Haoran, et autres
Publié: (2025)
MaterialPicker: Multi-Modal DiT-Based Material Generation
par: Ma, Xiaohe, et autres
Publié: (2024)
par: Ma, Xiaohe, et autres
Publié: (2024)
FlexAttention for Efficient High-Resolution Vision-Language Models
par: Li, Junyan, et autres
Publié: (2024)
par: Li, Junyan, et autres
Publié: (2024)
RATE-Nav: Region-Aware Termination Enhancement for Zero-shot Object Navigation with Vision-Language Models
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
GenView: Enhancing View Quality with Pretrained Generative Model for Self-Supervised Learning
par: Li, Xiaojie, et autres
Publié: (2024)
par: Li, Xiaojie, et autres
Publié: (2024)
Enhancing Multi-Agent Systems via Reinforcement Learning with LLM-based Planner and Graph-based Policy
par: Jia, Ziqi, et autres
Publié: (2025)
par: Jia, Ziqi, et autres
Publié: (2025)
EdgeRunner: Auto-regressive Auto-encoder for Artistic Mesh Generation
par: Tang, Jiaxiang, et autres
Publié: (2024)
par: Tang, Jiaxiang, et autres
Publié: (2024)
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
CharacterShot: Controllable and Consistent 4D Character Animation
par: Gao, Junyao, et autres
Publié: (2025)
par: Gao, Junyao, et autres
Publié: (2025)
Towards Open Vocabulary Learning: A Survey
par: Wu, Jianzong, et autres
Publié: (2023)
par: Wu, Jianzong, et autres
Publié: (2023)
Auto-Regressively Generating Multi-View Consistent Images
par: Hu, JiaKui, et autres
Publié: (2025)
par: Hu, JiaKui, et autres
Publié: (2025)
An Empirical Study of GPT-4o Image Generation Capabilities
par: Chen, Sixiang, et autres
Publié: (2025)
par: Chen, Sixiang, et autres
Publié: (2025)
Sagiri: Low Dynamic Range Image Enhancement with Generative Diffusion Prior
par: Li, Baiang, et autres
Publié: (2024)
par: Li, Baiang, et autres
Publié: (2024)
Dynamic Execution Commitment of Vision-Language-Action Models
par: Chen, Feng, et autres
Publié: (2026)
par: Chen, Feng, et autres
Publié: (2026)
EdgeSAM: Prompt-In-the-Loop Distillation for SAM
par: Zhou, Chong, et autres
Publié: (2023)
par: Zhou, Chong, et autres
Publié: (2023)
StyleShot: A Snapshot on Any Style
par: Gao, Junyao, et autres
Publié: (2024)
par: Gao, Junyao, et autres
Publié: (2024)
AutoLoRA: Automatic LoRA Retrieval and Fine-Grained Gated Fusion for Text-to-Image Generation
par: Li, Zhiwen, et autres
Publié: (2025)
par: Li, Zhiwen, et autres
Publié: (2025)
Skeleton-in-Context: Unified Skeleton Sequence Modeling with In-Context Learning
par: Wang, Xinshun, et autres
Publié: (2023)
par: Wang, Xinshun, et autres
Publié: (2023)
RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything
par: Xu, Shilin, et autres
Publié: (2024)
par: Xu, Shilin, et autres
Publié: (2024)
S^2F-Net:A Robust Spatial-Spectral Fusion Framework for Cross-Model AIGC Detection
par: Hu, Xiangyu, et autres
Publié: (2026)
par: Hu, Xiangyu, et autres
Publié: (2026)
Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
par: Yuan, Haobo, et autres
Publié: (2024)
par: Yuan, Haobo, et autres
Publié: (2024)
ModelNet-O: A Large-Scale Synthetic Dataset for Occlusion-Aware Point Cloud Classification
par: Fang, Zhongbin, et autres
Publié: (2024)
par: Fang, Zhongbin, et autres
Publié: (2024)
Documents similaires
-
MotionBooth: Motion-Aware Customized Text-to-Video Generation
par: Wu, Jianzong, et autres
Publié: (2024) -
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
par: Wu, Jianzong, et autres
Publié: (2024) -
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
par: Wu, Jianzong, et autres
Publié: (2024) -
An Open and Comprehensive Pipeline for Unified Object Grounding and Detection
par: Zhao, Xiangyu, et autres
Publié: (2024) -
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
par: Zhao, Xiangyu, et autres
Publié: (2024)