Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bai, Tianyi, Fan, Yuxuan, Qiu, Jiantao, Sun, Fupeng, Song, Jiayi, Han, Junlin, Liu, Zichen, He, Conghui, Zhang, Wentao, Yuan, Binhang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
par: Bai, Tianyi, et autres
Publié: (2025)
par: Bai, Tianyi, et autres
Publié: (2025)
Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration
par: Bai, Tianyi, et autres
Publié: (2024)
par: Bai, Tianyi, et autres
Publié: (2024)
Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code
par: Lin, Haobo, et autres
Publié: (2026)
par: Lin, Haobo, et autres
Publié: (2026)
VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL
par: Hu, Zengjie, et autres
Publié: (2025)
par: Hu, Zengjie, et autres
Publié: (2025)
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
par: Zhang, Qintong, et autres
Publié: (2025)
par: Zhang, Qintong, et autres
Publié: (2025)
Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
par: Deng, Haolin, et autres
Publié: (2026)
par: Deng, Haolin, et autres
Publié: (2026)
FineEdit: Fine-Grained Image Edit with Bounding Box Guidance
par: Xu, Haohang, et autres
Publié: (2026)
par: Xu, Haohang, et autres
Publié: (2026)
A Survey of Multimodal Large Language Model from A Data-centric Perspective
par: Bai, Tianyi, et autres
Publié: (2024)
par: Bai, Tianyi, et autres
Publié: (2024)
VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters
par: Fan, Jiaxin, et autres
Publié: (2026)
par: Fan, Jiaxin, et autres
Publié: (2026)
SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
par: Zarei, Arman, et autres
Publié: (2025)
par: Zarei, Arman, et autres
Publié: (2025)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
par: Xiao, Yicheng, et autres
Publié: (2026)
par: Xiao, Yicheng, et autres
Publié: (2026)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
par: Jin, Jing, et autres
Publié: (2026)
par: Jin, Jing, et autres
Publié: (2026)
Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models
par: Zhuang, Xinlin, et autres
Publié: (2025)
par: Zhuang, Xinlin, et autres
Publié: (2025)
Multilingual Fine-Grained News Headline Hallucination Detection
par: Shen, Jiaming, et autres
Publié: (2024)
par: Shen, Jiaming, et autres
Publié: (2024)
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
par: Liu, Tianyi, et autres
Publié: (2026)
par: Liu, Tianyi, et autres
Publié: (2026)
ZINA: Multimodal Fine-grained Hallucination Detection and Editing
par: Wada, Yuiga, et autres
Publié: (2025)
par: Wada, Yuiga, et autres
Publié: (2025)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
par: Zhao, Zhixian, et autres
Publié: (2026)
par: Zhao, Zhixian, et autres
Publié: (2026)
GlanceVAD: Exploring Glance Supervision for Label-efficient Video Anomaly Detection
par: Zhang, Huaxin, et autres
Publié: (2024)
par: Zhang, Huaxin, et autres
Publié: (2024)
EditScribe: Non-Visual Image Editing with Natural Language Verification Loops
par: Chang, Ruei-Che, et autres
Publié: (2024)
par: Chang, Ruei-Che, et autres
Publié: (2024)
C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
Fine-Grained Detection of Context-Grounded Hallucinations Using LLMs
par: Peisakhovsky, Yehonatan, et autres
Publié: (2025)
par: Peisakhovsky, Yehonatan, et autres
Publié: (2025)
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
par: Zhao, Haozhe, et autres
Publié: (2024)
par: Zhao, Haozhe, et autres
Publié: (2024)
Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization
par: Zhao, Zhiyuan, et autres
Publié: (2023)
par: Zhao, Zhiyuan, et autres
Publié: (2023)
Mask What Matters: Mitigating Object Hallucinations in Multimodal Large Language Models with Object-Aligned Visual Contrastive Decoding
par: Chen, Boqi, et autres
Publié: (2026)
par: Chen, Boqi, et autres
Publié: (2026)
DietGlance: Dietary Monitoring and Personalized Analysis at a Glance with Knowledge-Empowered AI Assistant
par: Jiang, Zhihan, et autres
Publié: (2025)
par: Jiang, Zhihan, et autres
Publié: (2025)
Fine-Grained Prototypes Distillation for Few-Shot Object Detection
par: Wang, Zichen, et autres
Publié: (2024)
par: Wang, Zichen, et autres
Publié: (2024)
GRAIT: Gradient-Driven Refusal-Aware Instruction Tuning for Effective Hallucination Mitigation
par: Zhu, Runchuan, et autres
Publié: (2025)
par: Zhu, Runchuan, et autres
Publié: (2025)
Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore
par: Oh, Hongseok, et autres
Publié: (2025)
par: Oh, Hongseok, et autres
Publié: (2025)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
par: Zhong, Weihong, et autres
Publié: (2024)
par: Zhong, Weihong, et autres
Publié: (2024)
CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
par: Li, Yan, et autres
Publié: (2025)
par: Li, Yan, et autres
Publié: (2025)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal Hallucination
par: Shi, Ziqiang, et autres
Publié: (2026)
par: Shi, Ziqiang, et autres
Publié: (2026)
Cross-Layer Attention Probing for Fine-Grained Hallucination Detection
par: Suresh, Malavika, et autres
Publié: (2025)
par: Suresh, Malavika, et autres
Publié: (2025)
Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
par: Bai, Ziyi, et autres
Publié: (2024)
par: Bai, Ziyi, et autres
Publié: (2024)
Novel Class Discovery for Ultra-Fine-Grained Visual Categorization
par: Liu, Yu, et autres
Publié: (2024)
par: Liu, Yu, et autres
Publié: (2024)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
par: Feng, Sicheng, et autres
Publié: (2025)
par: Feng, Sicheng, et autres
Publié: (2025)
Layer Importance and Hallucination Analysis in Large Language Models via Enhanced Activation Variance-Sparsity
par: Song, Zichen, et autres
Publié: (2024)
par: Song, Zichen, et autres
Publié: (2024)
Sparse Fine-Tuning of Transformers for Generative Tasks
par: Chen, Wei, et autres
Publié: (2025)
par: Chen, Wei, et autres
Publié: (2025)
PartEdit: Fine-Grained Image Editing using Pre-Trained Diffusion Models
par: Cvejic, Aleksandar, et autres
Publié: (2025)
par: Cvejic, Aleksandar, et autres
Publié: (2025)
Documents similaires
-
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
par: Bai, Tianyi, et autres
Publié: (2025) -
Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration
par: Bai, Tianyi, et autres
Publié: (2024) -
Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code
par: Lin, Haobo, et autres
Publié: (2026) -
VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL
par: Hu, Zengjie, et autres
Publié: (2025) -
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
par: Zhang, Qintong, et autres
Publié: (2025)