Order-Level Attention Similarity Across Language Models: A Latent Commonality
Fuente:
arXiv
Guardado en:
| Autores principales: | Liang, Jinglin, Zhong, Jin, Huang, Shuangping, Hu, Yunqing, Zhang, Huiyuan, Li, Huifang, Fan, Lixin, Gu, Hanlin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diffusion-Driven Data Replay: A Novel Approach to Combat Forgetting in Federated Class Continual Learning
por: Liang, Jinglin, et al.
Publicado: (2024)
por: Liang, Jinglin, et al.
Publicado: (2024)
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
por: Jin, Jikai, et al.
Publicado: (2025)
por: Jin, Jikai, et al.
Publicado: (2025)
FedCoT: Federated Chain-of-Thought Distillation for Large Language Models
por: Fan, Tao, et al.
Publicado: (2024)
por: Fan, Tao, et al.
Publicado: (2024)
FedMKT: Federated Mutual Knowledge Transfer for Large and Small Language Models
por: Fan, Tao, et al.
Publicado: (2024)
por: Fan, Tao, et al.
Publicado: (2024)
VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation
por: Tan, Junwen, et al.
Publicado: (2026)
por: Tan, Junwen, et al.
Publicado: (2026)
Disentangling Similarity and Relatedness in Topic Models
por: Xiao, Hanlin, et al.
Publicado: (2026)
por: Xiao, Hanlin, et al.
Publicado: (2026)
Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data
por: Li, Haoran, et al.
Publicado: (2024)
por: Li, Haoran, et al.
Publicado: (2024)
Multidimensional Consistency Improves Reasoning in Language Models
por: Lai, Huiyuan, et al.
Publicado: (2025)
por: Lai, Huiyuan, et al.
Publicado: (2025)
Towards Universality: Studying Mechanistic Similarity Across Language Model Architectures
por: Wang, Junxuan, et al.
Publicado: (2024)
por: Wang, Junxuan, et al.
Publicado: (2024)
mCoT: Multilingual Instruction Tuning for Reasoning Consistency in Language Models
por: Lai, Huiyuan, et al.
Publicado: (2024)
por: Lai, Huiyuan, et al.
Publicado: (2024)
Representation Decomposition for Learning Similarity and Contrastness Across Modalities for Affective Computing
por: Tian, Yuanhe, et al.
Publicado: (2025)
por: Tian, Yuanhe, et al.
Publicado: (2025)
Learning Hierarchical and Geometry-Aware Graph Representations for Text-to-CAD
por: Gong, Shengjie, et al.
Publicado: (2026)
por: Gong, Shengjie, et al.
Publicado: (2026)
Efficient Prompt Caching via Embedding Similarity
por: Zhu, Hanlin, et al.
Publicado: (2024)
por: Zhu, Hanlin, et al.
Publicado: (2024)
Interactional Fluency and Turn‐Managing Gestures Across Second Language Proficiency Levels: A Multimodal Analysis
por: Yen‐Liang (Eric) Lin, et al.
Publicado: (2026)
por: Yen‐Liang (Eric) Lin, et al.
Publicado: (2026)
Prescriptive Scaling Reveals the Evolution of Language Model Capabilities
por: Zhang, Hanlin, et al.
Publicado: (2026)
por: Zhang, Hanlin, et al.
Publicado: (2026)
Federated Heterogeneous Language Model Optimization for Hybrid Automatic Speech Recognition
por: Hong, Mengze, et al.
Publicado: (2026)
por: Hong, Mengze, et al.
Publicado: (2026)
Latent Multi-Head Attention for Small Language Models
por: Mehta, Sushant, et al.
Publicado: (2025)
por: Mehta, Sushant, et al.
Publicado: (2025)
Layer-Order Inversion: Rethinking Latent Multi-Hop Reasoning in Large Language Models
por: Liu, Xukai, et al.
Publicado: (2026)
por: Liu, Xukai, et al.
Publicado: (2026)
Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse Languages
por: Brinkmann, Jannik, et al.
Publicado: (2025)
por: Brinkmann, Jannik, et al.
Publicado: (2025)
OntoURL: A Benchmark for Evaluating Large Language Models on Symbolic Ontological Understanding, Reasoning and Learning
por: Zhang, Xiao, et al.
Publicado: (2025)
por: Zhang, Xiao, et al.
Publicado: (2025)
OrbitNVS: Harnessing Video Diffusion Priors for Novel View Synthesis
por: Liang, Jinglin, et al.
Publicado: (2026)
por: Liang, Jinglin, et al.
Publicado: (2026)
Optimizing Native Sparse Attention with Latent Attention and Local Global Alternating Strategies
por: Hu, Yuxuan, et al.
Publicado: (2025)
por: Hu, Yuxuan, et al.
Publicado: (2025)
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model
por: Zhang, Yizhe, et al.
Publicado: (2023)
por: Zhang, Yizhe, et al.
Publicado: (2023)
Beyond WER: Probing Whisper's Sub-token Decoder Across Diverse Language Resource Levels
por: Liang, Siyu, et al.
Publicado: (2025)
por: Liang, Siyu, et al.
Publicado: (2025)
Peer-Predictive Self-Training for Language Model Reasoning
por: Feng, Shi, et al.
Publicado: (2026)
por: Feng, Shi, et al.
Publicado: (2026)
Layers at Similar Depths Generate Similar Activations Across LLM Architectures
por: Wolfram, Christopher, et al.
Publicado: (2025)
por: Wolfram, Christopher, et al.
Publicado: (2025)
Reasoning Beyond Language: A Comprehensive Survey on Latent Chain-of-Thought Reasoning
por: Chen, Xinghao, et al.
Publicado: (2025)
por: Chen, Xinghao, et al.
Publicado: (2025)
Round Attention: A Novel Round-Level Attention Mechanism to Accelerate LLM Inference
por: Tang, Yaohua, et al.
Publicado: (2025)
por: Tang, Yaohua, et al.
Publicado: (2025)
DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration
por: Zhang, Hanzhi, et al.
Publicado: (2025)
por: Zhang, Hanzhi, et al.
Publicado: (2025)
Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning
por: Su, DiJia, et al.
Publicado: (2025)
por: Su, DiJia, et al.
Publicado: (2025)
Common 7B Language Models Already Possess Strong Math Capabilities
por: Li, Chen, et al.
Publicado: (2024)
por: Li, Chen, et al.
Publicado: (2024)
Neuron-Level Sequential Editing for Large Language Models
por: Jiang, Houcheng, et al.
Publicado: (2024)
por: Jiang, Houcheng, et al.
Publicado: (2024)
The Widespread Adoption of Large Language Model-Assisted Writing Across Society
por: Liang, Weixin, et al.
Publicado: (2025)
por: Liang, Weixin, et al.
Publicado: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
por: Gu, Yifeng, et al.
Publicado: (2025)
por: Gu, Yifeng, et al.
Publicado: (2025)
mPLM-Sim: Better Cross-Lingual Similarity and Transfer in Multilingual Pretrained Language Models
por: Lin, Peiqin, et al.
Publicado: (2023)
por: Lin, Peiqin, et al.
Publicado: (2023)
MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models
por: Cai, Yuanqing, et al.
Publicado: (2026)
por: Cai, Yuanqing, et al.
Publicado: (2026)
Similarity-Distance-Magnitude Language Models
por: Schmaltz, Allen
Publicado: (2025)
por: Schmaltz, Allen
Publicado: (2025)
Who Endorsed It? Measuring Authority Bias Across Expertise Levels in Language Models
por: Mammen, Priyanka Mary, et al.
Publicado: (2026)
por: Mammen, Priyanka Mary, et al.
Publicado: (2026)
Scaling Latent Reasoning via Looped Language Models
por: Zhu, Rui-Jie, et al.
Publicado: (2025)
por: Zhu, Rui-Jie, et al.
Publicado: (2025)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
por: Ma, Da, et al.
Publicado: (2024)
por: Ma, Da, et al.
Publicado: (2024)
Ejemplares similares
-
Diffusion-Driven Data Replay: A Novel Approach to Combat Forgetting in Federated Class Continual Learning
por: Liang, Jinglin, et al.
Publicado: (2024) -
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
por: Jin, Jikai, et al.
Publicado: (2025) -
FedCoT: Federated Chain-of-Thought Distillation for Large Language Models
por: Fan, Tao, et al.
Publicado: (2024) -
FedMKT: Federated Mutual Knowledge Transfer for Large and Small Language Models
por: Fan, Tao, et al.
Publicado: (2024) -
VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation
por: Tan, Junwen, et al.
Publicado: (2026)