On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yoo, Suho, Jang, Youngjoon, Chung, Joon Son |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
Fork-Merge Decoding: Enhancing Multimodal Understanding in Audio-Visual Large Language Models
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
Test-Time Augmentation for Pose-invariant Face Recognition
par: Jung, Jaemin, et autres
Publié: (2025)
par: Jung, Jaemin, et autres
Publié: (2025)
Deep Understanding of Sign Language for Sign to Subtitle Alignment
par: Jang, Youngjoon, et autres
Publié: (2025)
par: Jang, Youngjoon, et autres
Publié: (2025)
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
par: Jung, Chaeyoung, et autres
Publié: (2026)
par: Jung, Chaeyoung, et autres
Publié: (2026)
Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding
par: Woo, Jongbhin, et autres
Publié: (2024)
par: Woo, Jongbhin, et autres
Publié: (2024)
Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment
par: Jang, Youngjoon, et autres
Publié: (2025)
par: Jang, Youngjoon, et autres
Publié: (2025)
StochCA: A Novel Approach for Exploiting Pretrained Models with Cross-Attention
par: Seo, Seungwon, et autres
Publié: (2024)
par: Seo, Seungwon, et autres
Publié: (2024)
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
par: Liu, Xu, et autres
Publié: (2026)
par: Liu, Xu, et autres
Publié: (2026)
When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
par: Choi, Jiho, et autres
Publié: (2026)
par: Choi, Jiho, et autres
Publié: (2026)
EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture
par: Feng, Wenfeng, et autres
Publié: (2025)
par: Feng, Wenfeng, et autres
Publié: (2025)
SAGE: Sink-Aware Grounded Decoding for Multimodal Hallucination Mitigation
par: Shukla, Tripti, et autres
Publié: (2026)
par: Shukla, Tripti, et autres
Publié: (2026)
Attention Sinks in Diffusion Transformers: A Causal Analysis
par: Wu, Fangzheng, et autres
Publié: (2026)
par: Wu, Fangzheng, et autres
Publié: (2026)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
par: Guan, Yiran, et autres
Publié: (2026)
par: Guan, Yiran, et autres
Publié: (2026)
Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers
par: Lu, Andrew, et autres
Publié: (2025)
par: Lu, Andrew, et autres
Publié: (2025)
Advancing Cross-Domain Generalizability in Face Anti-Spoofing: Insights, Design, and Metrics
par: Kim, Hyojin, et autres
Publié: (2024)
par: Kim, Hyojin, et autres
Publié: (2024)
Foreground-Covering Prototype Generation and Matching for SAM-Aided Few-Shot Segmentation
par: Park, Suho, et autres
Publié: (2025)
par: Park, Suho, et autres
Publié: (2025)
Revisiting Misalignment in Multispectral Pedestrian Detection: A Language-Driven Approach for Cross-modal Alignment Fusion
par: Kim, Taeheon, et autres
Publié: (2024)
par: Kim, Taeheon, et autres
Publié: (2024)
Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions
par: Kim, Seongyu, et autres
Publié: (2026)
par: Kim, Seongyu, et autres
Publié: (2026)
Lost in Translation, Found in Context: Sign Language Translation with Contextual Cues
par: Jang, Youngjoon, et autres
Publié: (2025)
par: Jang, Youngjoon, et autres
Publié: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)
par: Anand, et autres
Publié: (2025)
Compose and Conquer: Diffusion-Based 3D Depth Aware Composable Image Synthesis
par: Lee, Jonghyun, et autres
Publié: (2024)
par: Lee, Jonghyun, et autres
Publié: (2024)
CoT-Segmenter: Enhancing OOD Detection in Dense Road Scenes via Chain-of-Thought Reasoning
par: Song, Jeonghyo, et autres
Publié: (2025)
par: Song, Jeonghyo, et autres
Publié: (2025)
Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning
par: Yi, Shuai, et autres
Publié: (2026)
par: Yi, Shuai, et autres
Publié: (2026)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
par: Yu, Youngjoon, et autres
Publié: (2024)
par: Yu, Youngjoon, et autres
Publié: (2024)
Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression
par: Yi, Jung, et autres
Publié: (2025)
par: Yi, Jung, et autres
Publié: (2025)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
par: Liang, Susan, et autres
Publié: (2026)
par: Liang, Susan, et autres
Publié: (2026)
Domain-generalizable Face Anti-Spoofing with Patch-based Multi-tasking and Artifact Pattern Conversion
par: Jung, Seungjin, et autres
Publié: (2026)
par: Jung, Seungjin, et autres
Publié: (2026)
Hearing and Seeing Through CLIP: A Framework for Self-Supervised Sound Source Localization
par: Park, Sooyoung, et autres
Publié: (2025)
par: Park, Sooyoung, et autres
Publié: (2025)
OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World
par: Liu, Katherine, et autres
Publié: (2025)
par: Liu, Katherine, et autres
Publié: (2025)
MambaVideo for Discrete Video Tokenization with Channel-Split Quantization
par: Argaw, Dawit Mureja, et autres
Publié: (2025)
par: Argaw, Dawit Mureja, et autres
Publié: (2025)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
par: Rho, Kyeongha, et autres
Publié: (2025)
par: Rho, Kyeongha, et autres
Publié: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
Locally Grouped and Scale-Guided Attention for Dense Pest Counting
par: Son, Chang-Hwan
Publié: (2024)
par: Son, Chang-Hwan
Publié: (2024)
DriverGaze360: OmniDirectional Driver Attention with Object-Level Guidance
par: Govil, Shreedhar, et autres
Publié: (2025)
par: Govil, Shreedhar, et autres
Publié: (2025)
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
par: Ye, Junliang, et autres
Publié: (2025)
par: Ye, Junliang, et autres
Publié: (2025)
Continual-MEGA: A Large-scale Benchmark for Generalizable Continual Anomaly Detection
par: Lee, Geonu, et autres
Publié: (2025)
par: Lee, Geonu, et autres
Publié: (2025)
Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking
par: Chung, Sangyun, et autres
Publié: (2024)
par: Chung, Sangyun, et autres
Publié: (2024)
OmniLocalRF: Omnidirectional Local Radiance Fields from Dynamic Videos
par: Choi, Dongyoung, et autres
Publié: (2024)
par: Choi, Dongyoung, et autres
Publié: (2024)
OmniRe: Omni Urban Scene Reconstruction
par: Chen, Ziyu, et autres
Publié: (2024)
par: Chen, Ziyu, et autres
Publié: (2024)
Documents similaires
-
AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
par: Jung, Chaeyoung, et autres
Publié: (2025) -
Fork-Merge Decoding: Enhancing Multimodal Understanding in Audio-Visual Large Language Models
par: Jung, Chaeyoung, et autres
Publié: (2025) -
Test-Time Augmentation for Pose-invariant Face Recognition
par: Jung, Jaemin, et autres
Publié: (2025) -
Deep Understanding of Sign Language for Sign to Subtitle Alignment
par: Jang, Youngjoon, et autres
Publié: (2025) -
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
par: Jung, Chaeyoung, et autres
Publié: (2026)