CODE: Contrasting Self-generated Description to Combat Hallucination in Large Multi-modal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Junho, Kim, Hyunjun, Kim, Yeonju, Ro, Yong Man |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Models
par: Kim, Junho, et autres
Publié: (2024)
par: Kim, Junho, et autres
Publié: (2024)
SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis
par: Kim, Junho, et autres
Publié: (2024)
par: Kim, Junho, et autres
Publié: (2024)
ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding
par: Lee, Hosu, et autres
Publié: (2025)
par: Lee, Hosu, et autres
Publié: (2025)
Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing
par: Lee, Hosu, et autres
Publié: (2024)
par: Lee, Hosu, et autres
Publié: (2024)
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
par: Kim, Yeonju, et autres
Publié: (2024)
par: Kim, Yeonju, et autres
Publié: (2024)
Causal Unsupervised Semantic Segmentation
par: Kim, Junho, et autres
Publié: (2023)
par: Kim, Junho, et autres
Publié: (2023)
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
par: Kim, Junho, et autres
Publié: (2026)
par: Kim, Junho, et autres
Publié: (2026)
DIP-R1: Deep Inspection and Perception with RL Looking Through and Understanding Complex Scenes
par: Park, Sungjune, et autres
Publié: (2025)
par: Park, Sungjune, et autres
Publié: (2025)
AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
Robust Pedestrian Detection via Constructing Versatile Pedestrian Knowledge Bank
par: Park, Sungjune, et autres
Publié: (2024)
par: Park, Sungjune, et autres
Publié: (2024)
Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection
par: Park, Sungjune, et autres
Publié: (2023)
par: Park, Sungjune, et autres
Publié: (2023)
Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images
par: Park, Sungjune, et autres
Publié: (2025)
par: Park, Sungjune, et autres
Publié: (2025)
Revealing Multi-View Hallucination in Large Vision-Language Models
par: Park, Wooje, et autres
Publié: (2026)
par: Park, Wooje, et autres
Publié: (2026)
Visual Hallucinations of Multi-modal Large Language Models
par: Huang, Wen, et autres
Publié: (2024)
par: Huang, Wen, et autres
Publié: (2024)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
par: Park, Sungjune, et autres
Publié: (2025)
par: Park, Sungjune, et autres
Publié: (2025)
Pygmalion Effect in Vision: Image-to-Clay Translation for Reflective Geometry Reconstruction
par: Lee, Gayoung, et autres
Publié: (2025)
par: Lee, Gayoung, et autres
Publié: (2025)
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
Prompt Tuning of Deep Neural Networks for Speaker-adaptive Visual Speech Recognition
par: Kim, Minsu, et autres
Publié: (2023)
par: Kim, Minsu, et autres
Publié: (2023)
Attention-space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs
par: Jo, Yujin, et autres
Publié: (2026)
par: Jo, Yujin, et autres
Publié: (2026)
Visual Speech Recognition for Languages with Limited Labeled Data using Automatic Labels from Whisper
par: Yeo, Jeong Hun, et autres
Publié: (2023)
par: Yeo, Jeong Hun, et autres
Publié: (2023)
Programmable-Room: Interactive Textured 3D Room Meshes Generation Empowered by Large Language Models
par: Kim, Jihyun, et autres
Publié: (2025)
par: Kim, Jihyun, et autres
Publié: (2025)
GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
VG3T: Visual Geometry Grounded Gaussian Transformer
par: Kim, Junho, et autres
Publié: (2025)
par: Kim, Junho, et autres
Publié: (2025)
Simultaneous Long-tailed Recognition and Multi-modal Fusion for Highly Imbalanced Multi-modal Data
par: Yoon, Heegeon, et autres
Publié: (2026)
par: Yoon, Heegeon, et autres
Publié: (2026)
How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions
par: An, Na Min, et autres
Publié: (2025)
par: An, Na Min, et autres
Publié: (2025)
Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
MGHanD: Multi-modal Guidance for authentic Hand Diffusion
par: Eum, Taehyeon, et autres
Publié: (2025)
par: Eum, Taehyeon, et autres
Publié: (2025)
Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues
par: Park, Beomchan, et autres
Publié: (2026)
par: Park, Beomchan, et autres
Publié: (2026)
PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache Pruning
par: Sun, Fengyuan, et autres
Publié: (2025)
par: Sun, Fengyuan, et autres
Publié: (2025)
MSCoTDet: Language-driven Multi-modal Fusion for Improved Multispectral Pedestrian Detection
par: Kim, Taeheon, et autres
Publié: (2024)
par: Kim, Taeheon, et autres
Publié: (2024)
M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation
par: Park, Jonggwon, et autres
Publié: (2024)
par: Park, Jonggwon, et autres
Publié: (2024)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
par: Choi, Jeongsoo, et autres
Publié: (2023)
par: Choi, Jeongsoo, et autres
Publié: (2023)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2024)
par: Zhang, Yudong, et autres
Publié: (2024)
Solution for SMART-101 Challenge of CVPR Multi-modal Algorithmic Reasoning Task 2024
par: Ahn, Jinwoo, et autres
Publié: (2024)
par: Ahn, Jinwoo, et autres
Publié: (2024)
DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning
par: Yoon, Junho, et autres
Publié: (2025)
par: Yoon, Junho, et autres
Publié: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding
par: Min, Kyungmin, et autres
Publié: (2024)
par: Min, Kyungmin, et autres
Publié: (2024)
Revisiting Misalignment in Multispectral Pedestrian Detection: A Language-Driven Approach for Cross-modal Alignment Fusion
par: Kim, Taeheon, et autres
Publié: (2024)
par: Kim, Taeheon, et autres
Publié: (2024)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
par: Kim, Donghoon, et autres
Publié: (2024)
par: Kim, Donghoon, et autres
Publié: (2024)
SDCD: Structure-Disrupted Contrastive Decoding for Mitigating Hallucinations in Large Vision-Language Models
par: Xia, Yuxuan, et autres
Publié: (2026)
par: Xia, Yuxuan, et autres
Publié: (2026)
Mitigating Hallucinations in Video Large Language Models via Spatiotemporal-Semantic Contrastive Decoding
par: Gao, Yuansheng, et autres
Publié: (2026)
par: Gao, Yuansheng, et autres
Publié: (2026)
Documents similaires
-
What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Models
par: Kim, Junho, et autres
Publié: (2024) -
SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis
par: Kim, Junho, et autres
Publié: (2024) -
ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding
par: Lee, Hosu, et autres
Publié: (2025) -
Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing
par: Lee, Hosu, et autres
Publié: (2024) -
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
par: Kim, Yeonju, et autres
Publié: (2024)