Block-Wise Differentiable Sinkhorn Attention: Tail-Refinement Gradients with a Gap-Aware Dustbin Bridge
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Forde, Dylan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models
par: Xi, Haocheng, et autres
Publié: (2026)
par: Xi, Haocheng, et autres
Publié: (2026)
Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations
par: Blumenberg, Patrick, et autres
Publié: (2025)
par: Blumenberg, Patrick, et autres
Publié: (2025)
Sinkhorn Distance Minimization for Knowledge Distillation
par: Cui, Xiao, et autres
Publié: (2024)
par: Cui, Xiao, et autres
Publié: (2024)
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
par: Guo, Song, et autres
Publié: (2024)
par: Guo, Song, et autres
Publié: (2024)
Optimizing Mixture of Block Attention
par: Xiao, Guangxuan, et autres
Publié: (2025)
par: Xiao, Guangxuan, et autres
Publié: (2025)
AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for Transformers
par: Achtibat, Reduan, et autres
Publié: (2024)
par: Achtibat, Reduan, et autres
Publié: (2024)
Listening to the Wise Few: Select-and-Copy Attention Heads for Multiple-Choice QA
par: Tulchinskii, Eduard, et autres
Publié: (2024)
par: Tulchinskii, Eduard, et autres
Publié: (2024)
Depth-Wise Attention (DWAtt): A Layer Fusion Method for Data-Efficient Classification
par: ElNokrashy, Muhammad, et autres
Publié: (2022)
par: ElNokrashy, Muhammad, et autres
Publié: (2022)
Block Sparse Flash Attention
par: Ohayon, Daniel, et autres
Publié: (2025)
par: Ohayon, Daniel, et autres
Publié: (2025)
Explainable AI: Context-Aware Layer-Wise Integrated Gradients for Explaining Transformer Models
par: Mersha, Melkamu Abay, et autres
Publié: (2026)
par: Mersha, Melkamu Abay, et autres
Publié: (2026)
Bridging the Gap for Test-Time Multimodal Sentiment Analysis
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Review, Remask, Refine (R3): Process-Guided Block Diffusion for Text Generation
par: Mounier, Nikita, et autres
Publié: (2025)
par: Mounier, Nikita, et autres
Publié: (2025)
Block-Attention for Efficient Prefilling
par: Ma, Dongyang, et autres
Publié: (2024)
par: Ma, Dongyang, et autres
Publié: (2024)
Hidden Heroes and Gradient Bloats: Layer-Wise Redundancy Inverts Attribution in Transformers
par: Ye, Donald
Publié: (2026)
par: Ye, Donald
Publié: (2026)
Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms
par: Xiao, Zeguan, et autres
Publié: (2025)
par: Xiao, Zeguan, et autres
Publié: (2025)
Intent-Aware Schema Generation And Refinement For Literature Review Tables
par: Padmakumar, Vishakh, et autres
Publié: (2025)
par: Padmakumar, Vishakh, et autres
Publié: (2025)
Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
par: Qiu, Quantong, et autres
Publié: (2026)
par: Qiu, Quantong, et autres
Publié: (2026)
AdaSplash-2: Faster Differentiable Sparse Attention
par: Gonçalves, Nuno, et autres
Publié: (2026)
par: Gonçalves, Nuno, et autres
Publié: (2026)
TRAM: Bridging Trust Regions and Sharpness Aware Minimization
par: Sherborne, Tom, et autres
Publié: (2023)
par: Sherborne, Tom, et autres
Publié: (2023)
Bridging Human and LLM Judgments: Understanding and Narrowing the Gap
par: Polo, Felipe Maia, et autres
Publié: (2025)
par: Polo, Felipe Maia, et autres
Publié: (2025)
Bridging the Gap Between Preference Alignment and Machine Unlearning
par: Feng, Xiaohua, et autres
Publié: (2025)
par: Feng, Xiaohua, et autres
Publié: (2025)
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
par: Wang, Yanshu, et autres
Publié: (2024)
par: Wang, Yanshu, et autres
Publié: (2024)
Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models
par: Kunstner, Frederik, et autres
Publié: (2024)
par: Kunstner, Frederik, et autres
Publié: (2024)
DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention
par: Huang, Yuxiang, et autres
Publié: (2026)
par: Huang, Yuxiang, et autres
Publié: (2026)
Gradient-guided Attention Map Editing: Towards Efficient Contextual Hallucination Mitigation
par: Wang, Yu, et autres
Publié: (2025)
par: Wang, Yu, et autres
Publié: (2025)
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling
par: Li, Yizhi, et autres
Publié: (2025)
par: Li, Yizhi, et autres
Publié: (2025)
EntmaxKV: Support-Aware Decoding for Entmax Attention
par: Duarte, Gonçalo, et autres
Publié: (2026)
par: Duarte, Gonçalo, et autres
Publié: (2026)
ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition
par: Ye, Lu, et autres
Publié: (2024)
par: Ye, Lu, et autres
Publié: (2024)
MoBA: Mixture of Block Attention for Long-Context LLMs
par: Lu, Enzhe, et autres
Publié: (2025)
par: Lu, Enzhe, et autres
Publié: (2025)
Learn Globally, Speak Locally: Bridging the Gaps in Multilingual Reasoning
par: Hwang, Jaedong, et autres
Publié: (2025)
par: Hwang, Jaedong, et autres
Publié: (2025)
LLM Tree Search
par: Wilson, Dylan
Publié: (2024)
par: Wilson, Dylan
Publié: (2024)
LayerBoost: Layer-Aware Attention Reduction for Efficient LLMs
par: Souibgui, Mohamed Ali, et autres
Publié: (2026)
par: Souibgui, Mohamed Ali, et autres
Publié: (2026)
OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling
par: Lou, Yuxuan, et autres
Publié: (2026)
par: Lou, Yuxuan, et autres
Publié: (2026)
Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse
par: Fu, Zizhuo, et autres
Publié: (2026)
par: Fu, Zizhuo, et autres
Publié: (2026)
Towards Unified Task Embeddings Across Multiple Models: Bridging the Gap for Prompt-Based Large Language Models and Beyond
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
Bridging the Gap: Dynamic Learning Strategies for Improving Multilingual Performance in LLMs
par: Kumar, Somnath, et autres
Publié: (2024)
par: Kumar, Somnath, et autres
Publié: (2024)
Enhancing Rare Codes via Probability-Biased Directed Graph Attention for Long-Tail ICD Coding
par: Chen, Tianlei, et autres
Publié: (2025)
par: Chen, Tianlei, et autres
Publié: (2025)
Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models
par: Das, Anindya Sundar, et autres
Publié: (2025)
par: Das, Anindya Sundar, et autres
Publié: (2025)
CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs
par: Liu, Yuanxiang, et autres
Publié: (2026)
par: Liu, Yuanxiang, et autres
Publié: (2026)
Reciprocal Co-Training (RCT): Coupling Gradient-Based and Non-Differentiable Models via Reinforcement Learning
par: Tian, Yunshuo, et autres
Publié: (2026)
par: Tian, Yunshuo, et autres
Publié: (2026)
Documents similaires
-
LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models
par: Xi, Haocheng, et autres
Publié: (2026) -
Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations
par: Blumenberg, Patrick, et autres
Publié: (2025) -
Sinkhorn Distance Minimization for Knowledge Distillation
par: Cui, Xiao, et autres
Publié: (2024) -
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
par: Guo, Song, et autres
Publié: (2024) -
Optimizing Mixture of Block Attention
par: Xiao, Guangxuan, et autres
Publié: (2025)