Perturbed examples reveal invariances shared by language models
Fuente:
arXiv
Guardado en:
| Autores principales: | Rawal, Ruchit, Toneva, Mariya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Tracking Equivalent Mechanistic Interpretations Across Neural Networks
por: Sun, Alan, et al.
Publicado: (2026)
por: Sun, Alan, et al.
Publicado: (2026)
Speech language models lack important brain-relevant semantics
por: Oota, Subba Reddy, et al.
Publicado: (2023)
por: Oota, Subba Reddy, et al.
Publicado: (2023)
Language models and brains align due to more than next-word prediction and word-level information
por: Merlin, Gabriele, et al.
Publicado: (2022)
por: Merlin, Gabriele, et al.
Publicado: (2022)
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
por: Moussa, Omer, et al.
Publicado: (2025)
por: Moussa, Omer, et al.
Publicado: (2025)
When Language Models Lose Their Mind: The Consequences of Brain Misalignment
por: Merlin, Gabriele, et al.
Publicado: (2026)
por: Merlin, Gabriele, et al.
Publicado: (2026)
Perturbation: A simple and efficient adversarial tracer for representation learning in language models
por: Rozner, Joshua, et al.
Publicado: (2026)
por: Rozner, Joshua, et al.
Publicado: (2026)
Brain-tuned Speech Models Better Reflect Speech Processing Stages in the Brain
por: Moussa, Omer, et al.
Publicado: (2025)
por: Moussa, Omer, et al.
Publicado: (2025)
Fine-grained Analysis of Brain-LLM Alignment through Input Attribution
por: Proietti, Michela, et al.
Publicado: (2025)
por: Proietti, Michela, et al.
Publicado: (2025)
Assessing Episodic Memory in LLMs with Sequence Order Recall Tasks
por: Pink, Mathis, et al.
Publicado: (2024)
por: Pink, Mathis, et al.
Publicado: (2024)
Data-free Defense of Black Box Models Against Adversarial Attacks
por: Nayak, Gaurav Kumar, et al.
Publicado: (2022)
por: Nayak, Gaurav Kumar, et al.
Publicado: (2022)
Improving Semantic Understanding in Speech Language Models via Brain-tuning
por: Moussa, Omer, et al.
Publicado: (2024)
por: Moussa, Omer, et al.
Publicado: (2024)
Modeling the language cortex with form-independent and enriched representations of sentence meaning reveals remarkable semantic abstractness
por: Saha, Shreya, et al.
Publicado: (2025)
por: Saha, Shreya, et al.
Publicado: (2025)
Hints Help Finding and Fixing Bugs Differently in Python and Text-based Program Representations
por: Rawal, Ruchit, et al.
Publicado: (2024)
por: Rawal, Ruchit, et al.
Publicado: (2024)
Aligning language models with human preferences
por: Korbak, Tomasz
Publicado: (2024)
por: Korbak, Tomasz
Publicado: (2024)
Evaluating language models as risk scores
por: Cruz, André F., et al.
Publicado: (2024)
por: Cruz, André F., et al.
Publicado: (2024)
Amortizing intractable inference in large language models
por: Hu, Edward J., et al.
Publicado: (2023)
por: Hu, Edward J., et al.
Publicado: (2023)
A mean teacher algorithm for unlearning of language models
por: Klochkov, Yegor
Publicado: (2025)
por: Klochkov, Yegor
Publicado: (2025)
Do language models plan ahead for future tokens?
por: Wu, Wilson, et al.
Publicado: (2024)
por: Wu, Wilson, et al.
Publicado: (2024)
Visualizing token importance for black-box language models
por: Rauba, Paulius, et al.
Publicado: (2025)
por: Rauba, Paulius, et al.
Publicado: (2025)
SMLT-MUGC: Small, Medium, and Large Texts -- Machine versus User-Generated Content Detection and Comparison
por: Rawal, Anjali, et al.
Publicado: (2024)
por: Rawal, Anjali, et al.
Publicado: (2024)
Positional Biases Shift as Inputs Approach Context Window Limits
por: Veseli, Blerta, et al.
Publicado: (2025)
por: Veseli, Blerta, et al.
Publicado: (2025)
The language of time: a language model perspective on time-series foundation models
por: Xie, Yi, et al.
Publicado: (2025)
por: Xie, Yi, et al.
Publicado: (2025)
Prompt reinforcing for long-term planning of large language models
por: Lin, Hsien-Chin, et al.
Publicado: (2025)
por: Lin, Hsien-Chin, et al.
Publicado: (2025)
Machine-generated text detection prevents language model collapse
por: Drayson, George, et al.
Publicado: (2025)
por: Drayson, George, et al.
Publicado: (2025)
Zero-shot generation of synthetic neurosurgical data with large language models
por: Barr, Austin A., et al.
Publicado: (2025)
por: Barr, Austin A., et al.
Publicado: (2025)
Repetitions are not all alike: distinct mechanisms sustain repetition in language models
por: Mahaut, Matéo, et al.
Publicado: (2025)
por: Mahaut, Matéo, et al.
Publicado: (2025)
Mixture-of-Depths: Dynamically allocating compute in transformer-based language models
por: Raposo, David, et al.
Publicado: (2024)
por: Raposo, David, et al.
Publicado: (2024)
Anchor function: a type of benchmark functions for studying language models
por: Zhang, Zhongwang, et al.
Publicado: (2024)
por: Zhang, Zhongwang, et al.
Publicado: (2024)
Only relative ranks matter in weight-clustered large language models
por: Aizpurua, Borja, et al.
Publicado: (2026)
por: Aizpurua, Borja, et al.
Publicado: (2026)
Simple linear attention language models balance the recall-throughput tradeoff
por: Arora, Simran, et al.
Publicado: (2024)
por: Arora, Simran, et al.
Publicado: (2024)
How do language models learn facts? Dynamics, curricula and hallucinations
por: Zucchet, Nicolas, et al.
Publicado: (2025)
por: Zucchet, Nicolas, et al.
Publicado: (2025)
Just read twice: closing the recall gap for recurrent language models
por: Arora, Simran, et al.
Publicado: (2024)
por: Arora, Simran, et al.
Publicado: (2024)
Large Language Models as Model Organisms for Human Associative Learning
por: Kolling, Camila, et al.
Publicado: (2025)
por: Kolling, Camila, et al.
Publicado: (2025)
Representation in large language models
por: Yetman, Cameron
Publicado: (2025)
por: Yetman, Cameron
Publicado: (2025)
Question answering system of bridge design specification based on large language model
por: Zhang, Leye, et al.
Publicado: (2024)
por: Zhang, Leye, et al.
Publicado: (2024)
Linear representations in language models can change dramatically over a conversation
por: Lampinen, Andrew Kyle, et al.
Publicado: (2026)
por: Lampinen, Andrew Kyle, et al.
Publicado: (2026)
DataComp-LM: In search of the next generation of training sets for language models
por: Li, Jeffrey, et al.
Publicado: (2024)
por: Li, Jeffrey, et al.
Publicado: (2024)
B-score: Detecting biases in large language models using response history
por: Vo, An, et al.
Publicado: (2025)
por: Vo, An, et al.
Publicado: (2025)
The SMeL Test: A simple benchmark for media literacy in language models
por: Ahdritz, Gustaf, et al.
Publicado: (2025)
por: Ahdritz, Gustaf, et al.
Publicado: (2025)
The representation landscape of few-shot learning and fine-tuning in large language models
por: Doimo, Diego, et al.
Publicado: (2024)
por: Doimo, Diego, et al.
Publicado: (2024)
Ejemplares similares
-
Tracking Equivalent Mechanistic Interpretations Across Neural Networks
por: Sun, Alan, et al.
Publicado: (2026) -
Speech language models lack important brain-relevant semantics
por: Oota, Subba Reddy, et al.
Publicado: (2023) -
Language models and brains align due to more than next-word prediction and word-level information
por: Merlin, Gabriele, et al.
Publicado: (2022) -
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
por: Moussa, Omer, et al.
Publicado: (2025) -
When Language Models Lose Their Mind: The Consequences of Brain Misalignment
por: Merlin, Gabriele, et al.
Publicado: (2026)