Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Weixing, Ding, Zifeng, Gu, Jindong, Cao, Rui, Meinel, Christoph, de Melo, Gerard, Yang, Haojin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SeCoKD: Aligning Large Language Models for In-Context Learning with Fewer Shots
par: Wang, Weixing, et autres
Publié: (2024)
par: Wang, Weixing, et autres
Publié: (2024)
MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction
par: Wang, Chao, et autres
Publié: (2025)
par: Wang, Chao, et autres
Publié: (2025)
Feature Distribution Shift Mitigation with Contrastive Pretraining for Intrusion Detection
par: Wang, Weixing, et autres
Publié: (2024)
par: Wang, Weixing, et autres
Publié: (2024)
PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2025)
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2025)
Generalized Categories Discovery for Long-tailed Recognition
par: Li, Ziyun, et autres
Publié: (2023)
par: Li, Ziyun, et autres
Publié: (2023)
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
par: Zhao, Linxi, et autres
Publié: (2024)
par: Zhao, Linxi, et autres
Publié: (2024)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
par: Wang, Dixuan, et autres
Publié: (2024)
par: Wang, Dixuan, et autres
Publié: (2024)
TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models
par: Chang, Shenxu, et autres
Publié: (2025)
par: Chang, Shenxu, et autres
Publié: (2025)
Scalable Token-Level Hallucination Detection in Large Language Models
par: Min, Rui, et autres
Publié: (2026)
par: Min, Rui, et autres
Publié: (2026)
Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
par: Gu, Jihao, et autres
Publié: (2024)
par: Gu, Jihao, et autres
Publié: (2024)
Targeted Remasking: Replacing Token Editing with Token-to-Mask Refinement in Discrete Diffusion Language Models
par: Yao, Lin
Publié: (2026)
par: Yao, Lin
Publié: (2026)
Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations
par: Jiang, Nick, et autres
Publié: (2024)
par: Jiang, Nick, et autres
Publié: (2024)
On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
par: Seo, Hoigi, et autres
Publié: (2025)
par: Seo, Hoigi, et autres
Publié: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
par: Shang, Yuying, et autres
Publié: (2024)
par: Shang, Yuying, et autres
Publié: (2024)
The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models
par: Sun, Bohang, et autres
Publié: (2026)
par: Sun, Bohang, et autres
Publié: (2026)
Token Distillation: Attention-aware Input Embeddings For New Tokens
par: Dobler, Konstantin, et autres
Publié: (2025)
par: Dobler, Konstantin, et autres
Publié: (2025)
Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey
par: Li, Jindong, et autres
Publié: (2025)
par: Li, Jindong, et autres
Publié: (2025)
The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering
par: Li, Zhuowei, et autres
Publié: (2025)
par: Li, Zhuowei, et autres
Publié: (2025)
Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation
par: Wu, Ning, et autres
Publié: (2026)
par: Wu, Ning, et autres
Publié: (2026)
Distribution Prompting: Understanding the Expressivity of Language Models Through the Next-Token Distributions They Can Produce
par: Wang, Haojin, et autres
Publié: (2025)
par: Wang, Haojin, et autres
Publié: (2025)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model
par: Kim, Dongwon, et autres
Publié: (2026)
par: Kim, Dongwon, et autres
Publié: (2026)
Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
par: Wu, Jialin, et autres
Publié: (2026)
par: Wu, Jialin, et autres
Publié: (2026)
HalLoc: Token-level Localization of Hallucinations for Vision Language Models
par: Park, Eunkyu, et autres
Publié: (2025)
par: Park, Eunkyu, et autres
Publié: (2025)
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
par: Wang, Xintong, et autres
Publié: (2024)
par: Wang, Xintong, et autres
Publié: (2024)
NEP: Autoregressive Image Editing via Next Editing Token Prediction
par: Wu, Huimin, et autres
Publié: (2025)
par: Wu, Huimin, et autres
Publié: (2025)
Mitigating Heterogeneous Token Overfitting in LLM Knowledge Editing
par: Liu, Tianci, et autres
Publié: (2025)
par: Liu, Tianci, et autres
Publié: (2025)
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)
par: Zhang, Huixuan, et autres
Publié: (2024)
Rethinking Token Reduction for Large Vision-Language Models
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination
par: Fa, Zhan, et autres
Publié: (2026)
par: Fa, Zhan, et autres
Publié: (2026)
ImbaGCD: Imbalanced Generalized Category Discovery
par: Li, Ziyun, et autres
Publié: (2023)
par: Li, Ziyun, et autres
Publié: (2023)
Enhancing Latent Computation in Transformers with Latent Tokens
par: Sun, Yuchang, et autres
Publié: (2025)
par: Sun, Yuchang, et autres
Publié: (2025)
DART: Differentiable Dynamic Adaptive Region Tokenizer for Vision Foundation Models
par: Yin, Shicheng, et autres
Publié: (2025)
par: Yin, Shicheng, et autres
Publié: (2025)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
par: Zhong, Weihong, et autres
Publié: (2024)
par: Zhong, Weihong, et autres
Publié: (2024)
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models
par: Liu, Wenrui, et autres
Publié: (2024)
par: Liu, Wenrui, et autres
Publié: (2024)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
par: Lu, Yifan, et autres
Publié: (2025)
par: Lu, Yifan, et autres
Publié: (2025)
Beyond Single Models: Mitigating Multimodal Hallucinations via Adaptive Token Ensemble Decoding
par: Li, Jinlin, et autres
Publié: (2025)
par: Li, Jinlin, et autres
Publié: (2025)
VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification
par: Zhuang, Xianwei, et autres
Publié: (2025)
par: Zhuang, Xianwei, et autres
Publié: (2025)
On the Adversarial Robustness of Discrete Image Tokenizers
par: Bhagwatkar, Rishika, et autres
Publié: (2026)
par: Bhagwatkar, Rishika, et autres
Publié: (2026)
Language Adaptation on a Tight Academic Compute Budget: Tokenizer Swapping Works and Pure bfloat16 Is Enough
par: Dobler, Konstantin, et autres
Publié: (2024)
par: Dobler, Konstantin, et autres
Publié: (2024)
Documents similaires
-
SeCoKD: Aligning Large Language Models for In-Context Learning with Fewer Shots
par: Wang, Weixing, et autres
Publié: (2024) -
MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction
par: Wang, Chao, et autres
Publié: (2025) -
Feature Distribution Shift Mitigation with Contrastive Pretraining for Intrusion Detection
par: Wang, Weixing, et autres
Publié: (2024) -
PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2025) -
Generalized Categories Discovery for Long-tailed Recognition
par: Li, Ziyun, et autres
Publié: (2023)