Guardado en:
| Autores principales: | An, Jingkun, Zhu, Yinghao, Li, Zongjian, Zhou, Enshen, Feng, Haoran, Huang, Xijie, Chen, Bohua, Shi, Yemin, Pan, Chengwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2403.13352 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
por: Huang, Xijie, et al.
Publicado: (2024)
por: Huang, Xijie, et al.
Publicado: (2024)
SoPo: Text-to-Motion Generation Using Semi-Online Preference Optimization
por: Tan, Xiaofeng, et al.
Publicado: (2024)
por: Tan, Xiaofeng, et al.
Publicado: (2024)
Scalable Ranked Preference Optimization for Text-to-Image Generation
por: Karthik, Shyamgopal, et al.
Publicado: (2024)
por: Karthik, Shyamgopal, et al.
Publicado: (2024)
LightM-UNet: Mamba Assists in Lightweight UNet for Medical Image Segmentation
por: Liao, Weibin, et al.
Publicado: (2024)
por: Liao, Weibin, et al.
Publicado: (2024)
Rich Human Feedback for Text-to-Image Generation
por: Liang, Youwei, et al.
Publicado: (2023)
por: Liang, Youwei, et al.
Publicado: (2023)
WebCode2M: A Real-World Dataset for Code Generation from Webpage Designs
por: Gui, Yi, et al.
Publicado: (2024)
por: Gui, Yi, et al.
Publicado: (2024)
SUDO: Enhancing Text-to-Image Diffusion Models with Self-Supervised Direct Preference Optimization
por: Peng, Liang, et al.
Publicado: (2025)
por: Peng, Liang, et al.
Publicado: (2025)
SuperGS: Consistent and Detailed 3D Super-Resolution Scene Reconstruction via Gaussian Splatting
por: Xie, Shiyun, et al.
Publicado: (2025)
por: Xie, Shiyun, et al.
Publicado: (2025)
SuperGS: Super-Resolution 3D Gaussian Splatting Enhanced by Variational Residual Features and Uncertainty-Augmented Learning
por: Xie, Shiyun, et al.
Publicado: (2024)
por: Xie, Shiyun, et al.
Publicado: (2024)
OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
por: Oh, Yoonjin, et al.
Publicado: (2025)
por: Oh, Yoonjin, et al.
Publicado: (2025)
Text-driven 3D Human Generation via Contrastive Preference Optimization
por: Zhou, Pengfei, et al.
Publicado: (2025)
por: Zhou, Pengfei, et al.
Publicado: (2025)
Helios: Real Real-Time Long Video Generation Model
por: Yuan, Shenghai, et al.
Publicado: (2026)
por: Yuan, Shenghai, et al.
Publicado: (2026)
Invisible Relevance Bias: Text-Image Retrieval Models Prefer AI-Generated Images
por: Xu, Shicheng, et al.
Publicado: (2023)
por: Xu, Shicheng, et al.
Publicado: (2023)
StyGazeTalk: Learning Stylized Generation of Gaze and Head Dynamics
por: Shi, Chengwei, et al.
Publicado: (2025)
por: Shi, Chengwei, et al.
Publicado: (2025)
Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker
por: Wu, Zongjian, et al.
Publicado: (2026)
por: Wu, Zongjian, et al.
Publicado: (2026)
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
por: Han, Yi, et al.
Publicado: (2025)
por: Han, Yi, et al.
Publicado: (2025)
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
por: Liu, Zhuohan, et al.
Publicado: (2026)
por: Liu, Zhuohan, et al.
Publicado: (2026)
HARIVO: Harnessing Text-to-Image Models for Video Generation
por: Kwon, Mingi, et al.
Publicado: (2024)
por: Kwon, Mingi, et al.
Publicado: (2024)
Preference Score Distillation: Leveraging 2D Rewards to Align Text-to-3D Generation with Human Preference
por: Leng, Jiaqi, et al.
Publicado: (2026)
por: Leng, Jiaqi, et al.
Publicado: (2026)
Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation
por: Wang, Zihao, et al.
Publicado: (2026)
por: Wang, Zihao, et al.
Publicado: (2026)
Learning Multi-dimensional Human Preference for Text-to-Image Generation
por: Zhang, Sixian, et al.
Publicado: (2024)
por: Zhang, Sixian, et al.
Publicado: (2024)
Preference Adaptive and Sequential Text-to-Image Generation
por: Nabati, Ofir, et al.
Publicado: (2024)
por: Nabati, Ofir, et al.
Publicado: (2024)
Expressive Text-to-Image Generation with Rich Text
por: Ge, Songwei, et al.
Publicado: (2023)
por: Ge, Songwei, et al.
Publicado: (2023)
IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation
por: Tang, Yinghao, et al.
Publicado: (2026)
por: Tang, Yinghao, et al.
Publicado: (2026)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)
por: Zhou, Enshen, et al.
Publicado: (2025)
Bringing Diversity from Diffusion Models to Semantic-Guided Face Asset Generation
por: Cai, Yunxuan, et al.
Publicado: (2025)
por: Cai, Yunxuan, et al.
Publicado: (2025)
Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization
por: Sun, Haoyuan, et al.
Publicado: (2024)
por: Sun, Haoyuan, et al.
Publicado: (2024)
Training-Free Text-to-Image Compositional Food Generation via Prompt Grafting
por: Pan, Xinyue, et al.
Publicado: (2026)
por: Pan, Xinyue, et al.
Publicado: (2026)
EmoGen: Emotional Image Content Generation with Text-to-Image Diffusion Models
por: Yang, Jingyuan, et al.
Publicado: (2024)
por: Yang, Jingyuan, et al.
Publicado: (2024)
InstructUDrag: Joint Text Instructions and Object Dragging for Interactive Image Editing
por: Yu, Haoran, et al.
Publicado: (2025)
por: Yu, Haoran, et al.
Publicado: (2025)
Anomaly-Preference Image Generation
por: Wang, Fuyun, et al.
Publicado: (2026)
por: Wang, Fuyun, et al.
Publicado: (2026)
Optimizing Negative Prompts for Enhanced Aesthetics and Fidelity in Text-To-Image Generation
por: Ogezi, Michael, et al.
Publicado: (2024)
por: Ogezi, Michael, et al.
Publicado: (2024)
Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation
por: Croitoru, Florinel-Alin, et al.
Publicado: (2026)
por: Croitoru, Florinel-Alin, et al.
Publicado: (2026)
A Difference-in-Difference Approach to Detecting AI-Generated Images
por: Qi, Xinyi, et al.
Publicado: (2026)
por: Qi, Xinyi, et al.
Publicado: (2026)
Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation
por: Wei, Tianyi, et al.
Publicado: (2024)
por: Wei, Tianyi, et al.
Publicado: (2024)
Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation
por: Lu, Xiaoxin, et al.
Publicado: (2025)
por: Lu, Xiaoxin, et al.
Publicado: (2025)
Stable-Pose: Leveraging Transformers for Pose-Guided Text-to-Image Generation
por: Wang, Jiajun, et al.
Publicado: (2024)
por: Wang, Jiajun, et al.
Publicado: (2024)
Optimizing Prompts for Text-to-Image Generation
por: Hao, Yaru, et al.
Publicado: (2022)
por: Hao, Yaru, et al.
Publicado: (2022)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
por: Yang, Xiaomeng, et al.
Publicado: (2025)
por: Yang, Xiaomeng, et al.
Publicado: (2025)
Text4Seg: Reimagining Image Segmentation as Text Generation
por: Lan, Mengcheng, et al.
Publicado: (2024)
por: Lan, Mengcheng, et al.
Publicado: (2024)
Ejemplares similares
-
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
por: Huang, Xijie, et al.
Publicado: (2024) -
SoPo: Text-to-Motion Generation Using Semi-Online Preference Optimization
por: Tan, Xiaofeng, et al.
Publicado: (2024) -
Scalable Ranked Preference Optimization for Text-to-Image Generation
por: Karthik, Shyamgopal, et al.
Publicado: (2024) -
LightM-UNet: Mamba Assists in Lightweight UNet for Medical Image Segmentation
por: Liao, Weibin, et al.
Publicado: (2024) -
Rich Human Feedback for Text-to-Image Generation
por: Liang, Youwei, et al.
Publicado: (2023)