Counting Hallucinations in Diffusion Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Fu, Shuai, Zhou, Jian, Chen, Qi, Jing, Huang, Nguyen, Huy Anh, Liu, Xiaohan, Zeng, Zhixiong, Ma, Lin, Zhang, Quanshi, Wu, Qi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base
por: Nguyen, Cong-Duy, et al.
Publicado: (2025)
por: Nguyen, Cong-Duy, et al.
Publicado: (2025)
Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models
por: Shoby, Abin, et al.
Publicado: (2026)
por: Shoby, Abin, et al.
Publicado: (2026)
Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
por: Chen, Lei, et al.
Publicado: (2025)
por: Chen, Lei, et al.
Publicado: (2025)
SwiftPie: Lightning-fast Subject-driven Image Personalization via One step Diffusion
por: Duong, Huy, et al.
Publicado: (2026)
por: Duong, Huy, et al.
Publicado: (2026)
Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models
por: Nguyen, Minh Khoi, et al.
Publicado: (2026)
por: Nguyen, Minh Khoi, et al.
Publicado: (2026)
HOIST-Former: Hand-held Objects Identification, Segmentation, and Tracking in the Wild
por: Narasimhaswamy, Supreeth, et al.
Publicado: (2024)
por: Narasimhaswamy, Supreeth, et al.
Publicado: (2024)
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
DocTron-Formula: Generalized Formula Recognition in Complex and Structured Scenarios
por: Zhong, Yufeng, et al.
Publicado: (2025)
por: Zhong, Yufeng, et al.
Publicado: (2025)
Detecting Precise Hand Touch Moments in Egocentric Video
por: Nguyen, Huy Anh, et al.
Publicado: (2026)
por: Nguyen, Huy Anh, et al.
Publicado: (2026)
Supercharged One-step Text-to-Image Diffusion Models with Negative Prompts
por: Nguyen, Viet, et al.
Publicado: (2024)
por: Nguyen, Viet, et al.
Publicado: (2024)
Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations
por: Nguyen, Tuan Dung, et al.
Publicado: (2026)
por: Nguyen, Tuan Dung, et al.
Publicado: (2026)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
por: Zhong, Yufeng, et al.
Publicado: (2026)
por: Zhong, Yufeng, et al.
Publicado: (2026)
Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation
por: Chen, Lei, et al.
Publicado: (2025)
por: Chen, Lei, et al.
Publicado: (2025)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
por: Chen, Feng, et al.
Publicado: (2024)
por: Chen, Feng, et al.
Publicado: (2024)
One-Shot Crowd Counting With Density Guidance For Scene Adaptation
por: Chen, Jiwei, et al.
Publicado: (2026)
por: Chen, Jiwei, et al.
Publicado: (2026)
TAB: Transformer Attention Bottlenecks enable User Intervention and Debugging in Vision-Language Models
por: Rahmanzadehgervi, Pooyan, et al.
Publicado: (2024)
por: Rahmanzadehgervi, Pooyan, et al.
Publicado: (2024)
SwiftBrush: One-Step Text-to-Image Diffusion Model with Variational Score Distillation
por: Nguyen, Thuan Hoang, et al.
Publicado: (2023)
por: Nguyen, Thuan Hoang, et al.
Publicado: (2023)
FA-Seg: A Fast and Accurate Diffusion-Based Method for Open-Vocabulary Segmentation
por: Che, Huy, et al.
Publicado: (2025)
por: Che, Huy, et al.
Publicado: (2025)
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
por: Chen, Boyuan, et al.
Publicado: (2026)
por: Chen, Boyuan, et al.
Publicado: (2026)
VMambaCC: A Visual State Space Model for Crowd Counting
por: Ma, Hao-Yuan, et al.
Publicado: (2024)
por: Ma, Hao-Yuan, et al.
Publicado: (2024)
Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts
por: Le, Minh, et al.
Publicado: (2025)
por: Le, Minh, et al.
Publicado: (2025)
SynMVCrowd: A Large Synthetic Benchmark for Multi-view Crowd Counting and Localization
por: Zhang, Qi, et al.
Publicado: (2026)
por: Zhang, Qi, et al.
Publicado: (2026)
Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs
por: Nguyen, Dung, et al.
Publicado: (2025)
por: Nguyen, Dung, et al.
Publicado: (2025)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
por: Qi, Zhangyang, et al.
Publicado: (2025)
por: Qi, Zhangyang, et al.
Publicado: (2025)
WAVER: Writing-style Agnostic Text-Video Retrieval via Distilling Vision-Language Models Through Open-Vocabulary Knowledge
por: Le, Huy, et al.
Publicado: (2023)
por: Le, Huy, et al.
Publicado: (2023)
FlexEdit: Flexible and Controllable Diffusion-based Object-centric Image Editing
por: Nguyen, Trong-Tung, et al.
Publicado: (2024)
por: Nguyen, Trong-Tung, et al.
Publicado: (2024)
Towards Efficient and Robust Moment Retrieval System: A Unified Framework for Multi-Granularity Models and Temporal Reranking
por: Tran, Huu-Loc, et al.
Publicado: (2025)
por: Tran, Huu-Loc, et al.
Publicado: (2025)
A Survey of Emerging Applications of Diffusion Probabilistic Models in MRI
por: Fan, Yuheng, et al.
Publicado: (2023)
por: Fan, Yuheng, et al.
Publicado: (2023)
Bridging Classification and Segmentation in Osteosarcoma Assessment via Foundation and Discrete Diffusion Models
por: Nguyen, Manh Duong, et al.
Publicado: (2025)
por: Nguyen, Manh Duong, et al.
Publicado: (2025)
CountEx: Fine-Grained Counting via Exemplars and Exclusion
por: Huang, Yifeng, et al.
Publicado: (2026)
por: Huang, Yifeng, et al.
Publicado: (2026)
SuMa: A Subspace Mapping Approach for Robust and Effective Concept Erasure in Text-to-Image Diffusion Models
por: Nguyen, Kien, et al.
Publicado: (2025)
por: Nguyen, Kien, et al.
Publicado: (2025)
Hallucination Early Detection in Diffusion Models
por: Betti, Federico, et al.
Publicado: (2026)
por: Betti, Federico, et al.
Publicado: (2026)
VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning
por: Zhao, Xuanle, et al.
Publicado: (2025)
por: Zhao, Xuanle, et al.
Publicado: (2025)
UItron: Foundational GUI Agent with Advanced Perception and Planning
por: Zeng, Zhixiong, et al.
Publicado: (2025)
por: Zeng, Zhixiong, et al.
Publicado: (2025)
OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds
por: Yang, Longrong, et al.
Publicado: (2025)
por: Yang, Longrong, et al.
Publicado: (2025)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
por: Fang, Xueji, et al.
Publicado: (2026)
por: Fang, Xueji, et al.
Publicado: (2026)
WSCF-MVCC: Weakly-supervised Calibration-free Multi-view Crowd Counting
por: Li, Bin, et al.
Publicado: (2025)
por: Li, Bin, et al.
Publicado: (2025)
HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction
por: Liu, Xi, et al.
Publicado: (2026)
por: Liu, Xi, et al.
Publicado: (2026)
CountSteer: Steering Attention for Object Counting in Diffusion Models
por: Boo, Hyemin, et al.
Publicado: (2025)
por: Boo, Hyemin, et al.
Publicado: (2025)
AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs
por: Chang, Boyu, et al.
Publicado: (2026)
por: Chang, Boyu, et al.
Publicado: (2026)
Ejemplares similares
-
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base
por: Nguyen, Cong-Duy, et al.
Publicado: (2025) -
Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models
por: Shoby, Abin, et al.
Publicado: (2026) -
Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
por: Chen, Lei, et al.
Publicado: (2025) -
SwiftPie: Lightning-fast Subject-driven Image Personalization via One step Diffusion
por: Duong, Huy, et al.
Publicado: (2026) -
Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models
por: Nguyen, Minh Khoi, et al.
Publicado: (2026)