Taming the Tri-Space Tension: ARC-Guided Hallucination Modeling and Control for Text-to-Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Jianjiang, Huang, Ziyan, li, Yanshu, Peng, Da, Yao, Huaiyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
par: Yang, Jianjiang, et autres
Publié: (2025)
par: Yang, Jianjiang, et autres
Publié: (2025)
TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
Taming Object Hallucinations with Verified Atomic Confidence Estimation
par: Liu, Jiarui, et autres
Publié: (2025)
par: Liu, Jiarui, et autres
Publié: (2025)
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
par: Li, Yanshu
Publié: (2025)
par: Li, Yanshu
Publié: (2025)
Fast Prompt Alignment for Text-to-Image Generation
par: Mrini, Khalil, et autres
Publié: (2024)
par: Mrini, Khalil, et autres
Publié: (2024)
Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation
par: Yang, Mingyue, et autres
Publié: (2025)
par: Yang, Mingyue, et autres
Publié: (2025)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
par: Huang, Jia-Hong, et autres
Publié: (2024)
par: Huang, Jia-Hong, et autres
Publié: (2024)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
par: Yang, Yue, et autres
Publié: (2025)
par: Yang, Yue, et autres
Publié: (2025)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
par: Chen, Kaijie, et autres
Publié: (2025)
par: Chen, Kaijie, et autres
Publié: (2025)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
par: Cheng, Sheng, et autres
Publié: (2024)
par: Cheng, Sheng, et autres
Publié: (2024)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
par: Ozaki, Shintaro, et autres
Publié: (2025)
par: Ozaki, Shintaro, et autres
Publié: (2025)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
par: You, Liangliang, et autres
Publié: (2025)
par: You, Liangliang, et autres
Publié: (2025)
Optimizing Prompts for Text-to-Image Generation
par: Hao, Yaru, et autres
Publié: (2022)
par: Hao, Yaru, et autres
Publié: (2022)
$λ$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space
par: Patel, Maitreya, et autres
Publié: (2024)
par: Patel, Maitreya, et autres
Publié: (2024)
Can Prompt Modifiers Control Bias? A Comparative Analysis of Text-to-Image Generative Models
par: Shin, Philip Wootaek, et autres
Publié: (2024)
par: Shin, Philip Wootaek, et autres
Publié: (2024)
Scaling Concept With Text-Guided Diffusion Models
par: Huang, Chao, et autres
Publié: (2024)
par: Huang, Chao, et autres
Publié: (2024)
AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models
par: Wu, Xiyang, et autres
Publié: (2024)
par: Wu, Xiyang, et autres
Publié: (2024)
Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision
par: Lee, Seongyun, et autres
Publié: (2023)
par: Lee, Seongyun, et autres
Publié: (2023)
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
par: Tang, Raphael, et autres
Publié: (2024)
par: Tang, Raphael, et autres
Publié: (2024)
Visually Guided Generative Text-Layout Pre-training for Document Intelligence
par: Mao, Zhiming, et autres
Publié: (2024)
par: Mao, Zhiming, et autres
Publié: (2024)
CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
Taming Stable Diffusion for Text to 360° Panorama Image Generation
par: Zhang, Cheng, et autres
Publié: (2024)
par: Zhang, Cheng, et autres
Publié: (2024)
Guided Score identity Distillation for Data-Free One-Step Text-to-Image Generation
par: Zhou, Mingyuan, et autres
Publié: (2024)
par: Zhou, Mingyuan, et autres
Publié: (2024)
Beyond Image-Text Matching: Verb Understanding in Multimodal Transformers Using Guided Masking
par: Beňová, Ivana, et autres
Publié: (2024)
par: Beňová, Ivana, et autres
Publié: (2024)
Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
Universal Prompt Optimizer for Safe Text-to-Image Generation
par: Wu, Zongyu, et autres
Publié: (2024)
par: Wu, Zongyu, et autres
Publié: (2024)
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)
par: Liu, Minqian, et autres
Publié: (2024)
DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter
par: Dong, Ziyi, et autres
Publié: (2022)
par: Dong, Ziyi, et autres
Publié: (2022)
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
par: Dong, Qihua, et autres
Publié: (2026)
par: Dong, Qihua, et autres
Publié: (2026)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
par: Sun, Yubo, et autres
Publié: (2025)
par: Sun, Yubo, et autres
Publié: (2025)
Navigating Text-to-Image Generative Bias across Indic Languages
par: Mittal, Surbhi, et autres
Publié: (2024)
par: Mittal, Surbhi, et autres
Publié: (2024)
MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning
par: Luo, Yuxuan, et autres
Publié: (2025)
par: Luo, Yuxuan, et autres
Publié: (2025)
TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
par: Mao, Weian, et autres
Publié: (2026)
par: Mao, Weian, et autres
Publié: (2026)
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
par: Fallah, Forouzan, et autres
Publié: (2025)
par: Fallah, Forouzan, et autres
Publié: (2025)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
par: Chen, Junzhe, et autres
Publié: (2024)
par: Chen, Junzhe, et autres
Publié: (2024)
Documents similaires
-
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
par: Yang, Jianjiang, et autres
Publié: (2025) -
TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration
par: Li, Yanshu, et autres
Publié: (2025) -
Taming Object Hallucinations with Verified Atomic Confidence Estimation
par: Liu, Jiarui, et autres
Publié: (2025) -
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025) -
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
par: Li, Yanshu
Publié: (2025)