Reversal Invariance in Autoregressive Language Models
Fuente:
arXiv
Guardado en:
| Autor principal: | Sahasrabudhe, Mihir |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Directional Optimization Asymmetry in Transformers: A Synthetic Stress Test
por: Sahasrabudhe, Mihir
Publicado: (2025)
por: Sahasrabudhe, Mihir
Publicado: (2025)
Marginals Before Conditionals
por: Sahasrabudhe, Mihir
Publicado: (2026)
por: Sahasrabudhe, Mihir
Publicado: (2026)
MixCE: Training Autoregressive Language Models by Mixing Forward and Reverse Cross-Entropies
por: Zhang, Shiyue, et al.
Publicado: (2023)
por: Zhang, Shiyue, et al.
Publicado: (2023)
Causal Autoregressive Diffusion Language Model
por: Ruan, Junhao, et al.
Publicado: (2026)
por: Ruan, Junhao, et al.
Publicado: (2026)
Revisiting Knowledge Distillation for Autoregressive Language Models
por: Zhong, Qihuang, et al.
Publicado: (2024)
por: Zhong, Qihuang, et al.
Publicado: (2024)
Autoregressive Large Language Models are Computationally Universal
por: Schuurmans, Dale, et al.
Publicado: (2024)
por: Schuurmans, Dale, et al.
Publicado: (2024)
Reverse Modeling in Large Language Models
por: Yu, Sicheng, et al.
Publicado: (2024)
por: Yu, Sicheng, et al.
Publicado: (2024)
Combining Autoregressive and Autoencoder Language Models for Text Classification
por: Gonçalves, João
Publicado: (2024)
por: Gonçalves, João
Publicado: (2024)
Scaling Diffusion Language Models via Adaptation from Autoregressive Models
por: Gong, Shansan, et al.
Publicado: (2024)
por: Gong, Shansan, et al.
Publicado: (2024)
Indic-TunedLens: Interpreting Multilingual Models in Indian Languages
por: Panchal, Mihir, et al.
Publicado: (2026)
por: Panchal, Mihir, et al.
Publicado: (2026)
Continuous Autoregressive Language Models
por: Shao, Chenze, et al.
Publicado: (2025)
por: Shao, Chenze, et al.
Publicado: (2025)
CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling
por: Čugalj, Dejan, et al.
Publicado: (2026)
por: Čugalj, Dejan, et al.
Publicado: (2026)
Incremental Sentence Processing Mechanisms in Autoregressive Transformer Language Models
por: Hanna, Michael, et al.
Publicado: (2024)
por: Hanna, Michael, et al.
Publicado: (2024)
MIXAR: Scaling Autoregressive Pixel-based Language Models to Multiple Languages and Scripts
por: Hu, Chen, et al.
Publicado: (2026)
por: Hu, Chen, et al.
Publicado: (2026)
AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?
por: Lin, Liang, et al.
Publicado: (2026)
por: Lin, Liang, et al.
Publicado: (2026)
GPT-SW3: An Autoregressive Language Model for the Nordic Languages
por: Ekgren, Ariel, et al.
Publicado: (2023)
por: Ekgren, Ariel, et al.
Publicado: (2023)
SMCLM: Semantically Meaningful Causal Language Modeling for Autoregressive Paraphrase Generation
por: Perełkiewicz, Michał, et al.
Publicado: (2025)
por: Perełkiewicz, Michał, et al.
Publicado: (2025)
Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective
por: Zhang, Siyue, et al.
Publicado: (2025)
por: Zhang, Siyue, et al.
Publicado: (2025)
LEDOM: Reverse Language Model
por: Yin, Xunjian, et al.
Publicado: (2025)
por: Yin, Xunjian, et al.
Publicado: (2025)
Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison
por: Vicentino, Caio
Publicado: (2026)
por: Vicentino, Caio
Publicado: (2026)
Exploring and Enhancing the Transfer of Distribution in Knowledge Distillation for Autoregressive Language Models
por: Rao, Jun, et al.
Publicado: (2024)
por: Rao, Jun, et al.
Publicado: (2024)
Differences in Text Generated by Diffusion and Autoregressive Language Models
por: Zhang, Zeyang, et al.
Publicado: (2026)
por: Zhang, Zeyang, et al.
Publicado: (2026)
RecycleGPT: An Autoregressive Language Model with Recyclable Module
por: Jiang, Yufan, et al.
Publicado: (2023)
por: Jiang, Yufan, et al.
Publicado: (2023)
Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
por: Sun, Bowen, et al.
Publicado: (2025)
por: Sun, Bowen, et al.
Publicado: (2025)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
por: Xiao, Yisong, et al.
Publicado: (2025)
por: Xiao, Yisong, et al.
Publicado: (2025)
Counterfactuals As a Means for Evaluating Faithfulness of Attribution Methods in Autoregressive Language Models
por: Kamahi, Sepehr, et al.
Publicado: (2024)
por: Kamahi, Sepehr, et al.
Publicado: (2024)
Towards Autoformalization of LLM-generated Outputs for Requirement Verification
por: Gupte, Mihir, et al.
Publicado: (2025)
por: Gupte, Mihir, et al.
Publicado: (2025)
One Language, Two Scripts: Probing Script-Invariance in LLM Concept Representations
por: Karne, Sripad
Publicado: (2026)
por: Karne, Sripad
Publicado: (2026)
From Bytes to Ideas: Language Modeling with Autoregressive U-Nets
por: Videau, Mathurin, et al.
Publicado: (2025)
por: Videau, Mathurin, et al.
Publicado: (2025)
Context Dependence and Reliability in Autoregressive Language Models
por: Sengupta, Poushali, et al.
Publicado: (2026)
por: Sengupta, Poushali, et al.
Publicado: (2026)
PEFT-Factory: Unified Parameter-Efficient Fine-Tuning of Autoregressive Large Language Models
por: Belanec, Robert, et al.
Publicado: (2025)
por: Belanec, Robert, et al.
Publicado: (2025)
Entropy-Guided Token Dropout: Training Autoregressive Language Models with Limited Domain Data
por: Wang, Jiapeng, et al.
Publicado: (2025)
por: Wang, Jiapeng, et al.
Publicado: (2025)
From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training
por: Liu, Tianqiao, et al.
Publicado: (2025)
por: Liu, Tianqiao, et al.
Publicado: (2025)
Magical: Medical Lay Language Generation via Semantic Invariance and Layperson-tailored Adaptation
por: Liao, Weibin, et al.
Publicado: (2025)
por: Liao, Weibin, et al.
Publicado: (2025)
Reversible Diffusion Decoding for Diffusion Language Models
por: Wang, Xinyun, et al.
Publicado: (2026)
por: Wang, Xinyun, et al.
Publicado: (2026)
Autoregressive Language Models for Knowledge Base Population: A case study in the space mission domain
por: García-Silva, Andrés, et al.
Publicado: (2025)
por: García-Silva, Andrés, et al.
Publicado: (2025)
Towards Closing the Autoregressive Gap in Language Modeling via Entropy-Gated Continuous Bitstream Diffusion
por: Batzolis, Georgios, et al.
Publicado: (2026)
por: Batzolis, Georgios, et al.
Publicado: (2026)
Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
por: Zhang, Ruixiang, et al.
Publicado: (2025)
por: Zhang, Ruixiang, et al.
Publicado: (2025)
Detecting Referring Expressions in Visually Grounded Dialogue with Autoregressive Language Models
por: Willemsen, Bram, et al.
Publicado: (2025)
por: Willemsen, Bram, et al.
Publicado: (2025)
Simulated Annealing Enhances Theory-of-Mind Reasoning in Autoregressive Language Models
por: Hu, Xucong, et al.
Publicado: (2026)
por: Hu, Xucong, et al.
Publicado: (2026)
Ejemplares similares
-
Directional Optimization Asymmetry in Transformers: A Synthetic Stress Test
por: Sahasrabudhe, Mihir
Publicado: (2025) -
Marginals Before Conditionals
por: Sahasrabudhe, Mihir
Publicado: (2026) -
MixCE: Training Autoregressive Language Models by Mixing Forward and Reverse Cross-Entropies
por: Zhang, Shiyue, et al.
Publicado: (2023) -
Causal Autoregressive Diffusion Language Model
por: Ruan, Junhao, et al.
Publicado: (2026) -
Revisiting Knowledge Distillation for Autoregressive Language Models
por: Zhong, Qihuang, et al.
Publicado: (2024)