Saved in:
| Main Authors: | Qiu, Junxiang, Wang, Shuo, Chen, Zhengsu, Zhang, Hengheng, Lu, Jinda, Li, Changcheng, Tian, Qi |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2601.02819 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation
by: Li, Changcheng, et al.
Published: (2026)
by: Li, Changcheng, et al.
Published: (2026)
Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
by: Yuan, Jingyang, et al.
Published: (2025)
by: Yuan, Jingyang, et al.
Published: (2025)
Punctuation-aware treebank tree binarization
by: Klinger, Eitan, et al.
Published: (2025)
by: Klinger, Eitan, et al.
Published: (2025)
Trainable Dynamic Mask Sparse Attention
by: Shi, Jingze, et al.
Published: (2025)
by: Shi, Jingze, et al.
Published: (2025)
Beyond Empathy: Integrating Diagnostic and Therapeutic Reasoning with Large Language Models for Mental Health Counseling
by: Hu, He, et al.
Published: (2025)
by: Hu, He, et al.
Published: (2025)
Punctuation and Predicates in Language Models
by: Chauhan, Sonakshi, et al.
Published: (2025)
by: Chauhan, Sonakshi, et al.
Published: (2025)
Accelerating Controllable Generation via Hybrid-grained Cache
by: Liu, Lin, et al.
Published: (2025)
by: Liu, Lin, et al.
Published: (2025)
Accelerating Diffusion Transformer via Gradient-Optimized Cache
by: Qiu, Junxiang, et al.
Published: (2025)
by: Qiu, Junxiang, et al.
Published: (2025)
FASA: Frequency-aware Sparse Attention
by: Wang, Yifei, et al.
Published: (2026)
by: Wang, Yifei, et al.
Published: (2026)
MeTA-LoRA: Data-Efficient Multi-Task Fine-Tuning for Large Language Models
by: Cheng, Bo, et al.
Published: (2025)
by: Cheng, Bo, et al.
Published: (2025)
ART: Attention Run-time Termination for Efficient Large Language Model Decoding
by: Qiu, Chen, et al.
Published: (2026)
by: Qiu, Chen, et al.
Published: (2026)
SparseD: Sparse Attention for Diffusion Language Models
by: Wang, Zeqing, et al.
Published: (2025)
by: Wang, Zeqing, et al.
Published: (2025)
Punctuation Restoration for Singaporean Spoken Languages: English, Malay, and Mandarin
by: Rao, Abhinav, et al.
Published: (2022)
by: Rao, Abhinav, et al.
Published: (2022)
Attention-Aligned Reasoning for Large Language Models
by: Zhang, Hongxiang, et al.
Published: (2025)
by: Zhang, Hongxiang, et al.
Published: (2025)
SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization
by: Zhang, Taolin, et al.
Published: (2026)
by: Zhang, Taolin, et al.
Published: (2026)
Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer
by: Dong, Yihe, et al.
Published: (2025)
by: Dong, Yihe, et al.
Published: (2025)
MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling
by: MiniCPM Team, et al.
Published: (2026)
by: MiniCPM Team, et al.
Published: (2026)
Predicting Punctuation in Ancient Chinese Texts: A Multi-Layered LSTM and Attention-Based Approach
by: Cai, Tracy, et al.
Published: (2024)
by: Cai, Tracy, et al.
Published: (2024)
Accelerating Diffusion Transformer via Error-Optimized Cache
by: Qiu, Junxiang, et al.
Published: (2025)
by: Qiu, Junxiang, et al.
Published: (2025)
Punctuation Prediction for Polish Texts using Transformers
by: Pokrywka, Jakub
Published: (2024)
by: Pokrywka, Jakub
Published: (2024)
A Small and Fast BERT for Chinese Medical Punctuation Restoration
by: Ling, Tongtao, et al.
Published: (2023)
by: Ling, Tongtao, et al.
Published: (2023)
Probabilistic Calibration Is a Trainable Capability in Language Models
by: Baldelli, Davide, et al.
Published: (2026)
by: Baldelli, Davide, et al.
Published: (2026)
SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space
by: Shen, Zhenyi, et al.
Published: (2025)
by: Shen, Zhenyi, et al.
Published: (2025)
End-to-end Joint Punctuated and Normalized ASR with a Limited Amount of Punctuated Training Data
by: Cui, Can, et al.
Published: (2023)
by: Cui, Can, et al.
Published: (2023)
Resolving Transcription Ambiguity in Spanish: A Hybrid Acoustic-Lexical System for Punctuation Restoration
by: Zhu, Xiliang, et al.
Published: (2024)
by: Zhu, Xiliang, et al.
Published: (2024)
Rhea: Role-aware Heuristic Episodic Attention for Conversational LLMs
by: Hong, Wanyang, et al.
Published: (2025)
by: Hong, Wanyang, et al.
Published: (2025)
A Hybrid Attention Framework for Fake News Detection with Large Language Models
by: Xu, Xiaochuan, et al.
Published: (2025)
by: Xu, Xiaochuan, et al.
Published: (2025)
How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective
by: Peng, Runyu, et al.
Published: (2026)
by: Peng, Runyu, et al.
Published: (2026)
Garbage Attention in Large Language Models: BOS Sink Heads and Sink-aware Pruning
by: Sok, Jaewon, et al.
Published: (2026)
by: Sok, Jaewon, et al.
Published: (2026)
Punctuation Restoration Improves Structure Understanding Without Supervision
by: Min, Junghyun, et al.
Published: (2024)
by: Min, Junghyun, et al.
Published: (2024)
Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
by: An, Wenbin, et al.
Published: (2024)
by: An, Wenbin, et al.
Published: (2024)
Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags
by: Qi, Daiqing, et al.
Published: (2024)
by: Qi, Daiqing, et al.
Published: (2024)
LLaMA based Punctuation Restoration With Forward Pass Only Decoding
by: Pang, Yutong, et al.
Published: (2024)
by: Pang, Yutong, et al.
Published: (2024)
Bias in Large Language Models: Origin, Evaluation, and Mitigation
by: Guo, Yufei, et al.
Published: (2024)
by: Guo, Yufei, et al.
Published: (2024)
ALPS: Attention Localization and Pruning Strategy for Efficient Alignment of Large Language Models
by: Chen, Hao, et al.
Published: (2025)
by: Chen, Hao, et al.
Published: (2025)
Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders
by: Zhang, Ruikang, et al.
Published: (2026)
by: Zhang, Ruikang, et al.
Published: (2026)
Optimizing Multi-Task Learning for Enhanced Performance in Large Language Models
by: Qi, Zhen, et al.
Published: (2024)
by: Qi, Zhen, et al.
Published: (2024)
Rectified Sparse Attention
by: Sun, Yutao, et al.
Published: (2025)
by: Sun, Yutao, et al.
Published: (2025)
Structure-aware Domain Knowledge Injection for Large Language Models
by: Liu, Kai, et al.
Published: (2024)
by: Liu, Kai, et al.
Published: (2024)
Advancing Text Classification with Large Language Models and Neural Attention Mechanisms
by: Lyu, Ning, et al.
Published: (2025)
by: Lyu, Ning, et al.
Published: (2025)
Similar Items
-
Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation
by: Li, Changcheng, et al.
Published: (2026) -
Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
by: Yuan, Jingyang, et al.
Published: (2025) -
Punctuation-aware treebank tree binarization
by: Klinger, Eitan, et al.
Published: (2025) -
Trainable Dynamic Mask Sparse Attention
by: Shi, Jingze, et al.
Published: (2025) -
Beyond Empathy: Integrating Diagnostic and Therapeutic Reasoning with Large Language Models for Mental Health Counseling
by: Hu, He, et al.
Published: (2025)