Perturbed examples reveal invariances shared by language models
Fuente:
arXiv
Salvato in:
| Autori principali: | Rawal, Ruchit, Toneva, Mariya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Tracking Equivalent Mechanistic Interpretations Across Neural Networks
di: Sun, Alan, et al.
Pubblicazione: (2026)
di: Sun, Alan, et al.
Pubblicazione: (2026)
Speech language models lack important brain-relevant semantics
di: Oota, Subba Reddy, et al.
Pubblicazione: (2023)
di: Oota, Subba Reddy, et al.
Pubblicazione: (2023)
Language models and brains align due to more than next-word prediction and word-level information
di: Merlin, Gabriele, et al.
Pubblicazione: (2022)
di: Merlin, Gabriele, et al.
Pubblicazione: (2022)
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
di: Moussa, Omer, et al.
Pubblicazione: (2025)
di: Moussa, Omer, et al.
Pubblicazione: (2025)
When Language Models Lose Their Mind: The Consequences of Brain Misalignment
di: Merlin, Gabriele, et al.
Pubblicazione: (2026)
di: Merlin, Gabriele, et al.
Pubblicazione: (2026)
Perturbation: A simple and efficient adversarial tracer for representation learning in language models
di: Rozner, Joshua, et al.
Pubblicazione: (2026)
di: Rozner, Joshua, et al.
Pubblicazione: (2026)
Brain-tuned Speech Models Better Reflect Speech Processing Stages in the Brain
di: Moussa, Omer, et al.
Pubblicazione: (2025)
di: Moussa, Omer, et al.
Pubblicazione: (2025)
Fine-grained Analysis of Brain-LLM Alignment through Input Attribution
di: Proietti, Michela, et al.
Pubblicazione: (2025)
di: Proietti, Michela, et al.
Pubblicazione: (2025)
Assessing Episodic Memory in LLMs with Sequence Order Recall Tasks
di: Pink, Mathis, et al.
Pubblicazione: (2024)
di: Pink, Mathis, et al.
Pubblicazione: (2024)
Data-free Defense of Black Box Models Against Adversarial Attacks
di: Nayak, Gaurav Kumar, et al.
Pubblicazione: (2022)
di: Nayak, Gaurav Kumar, et al.
Pubblicazione: (2022)
Improving Semantic Understanding in Speech Language Models via Brain-tuning
di: Moussa, Omer, et al.
Pubblicazione: (2024)
di: Moussa, Omer, et al.
Pubblicazione: (2024)
Modeling the language cortex with form-independent and enriched representations of sentence meaning reveals remarkable semantic abstractness
di: Saha, Shreya, et al.
Pubblicazione: (2025)
di: Saha, Shreya, et al.
Pubblicazione: (2025)
Hints Help Finding and Fixing Bugs Differently in Python and Text-based Program Representations
di: Rawal, Ruchit, et al.
Pubblicazione: (2024)
di: Rawal, Ruchit, et al.
Pubblicazione: (2024)
Aligning language models with human preferences
di: Korbak, Tomasz
Pubblicazione: (2024)
di: Korbak, Tomasz
Pubblicazione: (2024)
Evaluating language models as risk scores
di: Cruz, André F., et al.
Pubblicazione: (2024)
di: Cruz, André F., et al.
Pubblicazione: (2024)
Amortizing intractable inference in large language models
di: Hu, Edward J., et al.
Pubblicazione: (2023)
di: Hu, Edward J., et al.
Pubblicazione: (2023)
A mean teacher algorithm for unlearning of language models
di: Klochkov, Yegor
Pubblicazione: (2025)
di: Klochkov, Yegor
Pubblicazione: (2025)
Do language models plan ahead for future tokens?
di: Wu, Wilson, et al.
Pubblicazione: (2024)
di: Wu, Wilson, et al.
Pubblicazione: (2024)
Visualizing token importance for black-box language models
di: Rauba, Paulius, et al.
Pubblicazione: (2025)
di: Rauba, Paulius, et al.
Pubblicazione: (2025)
SMLT-MUGC: Small, Medium, and Large Texts -- Machine versus User-Generated Content Detection and Comparison
di: Rawal, Anjali, et al.
Pubblicazione: (2024)
di: Rawal, Anjali, et al.
Pubblicazione: (2024)
Positional Biases Shift as Inputs Approach Context Window Limits
di: Veseli, Blerta, et al.
Pubblicazione: (2025)
di: Veseli, Blerta, et al.
Pubblicazione: (2025)
The language of time: a language model perspective on time-series foundation models
di: Xie, Yi, et al.
Pubblicazione: (2025)
di: Xie, Yi, et al.
Pubblicazione: (2025)
Prompt reinforcing for long-term planning of large language models
di: Lin, Hsien-Chin, et al.
Pubblicazione: (2025)
di: Lin, Hsien-Chin, et al.
Pubblicazione: (2025)
Machine-generated text detection prevents language model collapse
di: Drayson, George, et al.
Pubblicazione: (2025)
di: Drayson, George, et al.
Pubblicazione: (2025)
Zero-shot generation of synthetic neurosurgical data with large language models
di: Barr, Austin A., et al.
Pubblicazione: (2025)
di: Barr, Austin A., et al.
Pubblicazione: (2025)
Repetitions are not all alike: distinct mechanisms sustain repetition in language models
di: Mahaut, Matéo, et al.
Pubblicazione: (2025)
di: Mahaut, Matéo, et al.
Pubblicazione: (2025)
Mixture-of-Depths: Dynamically allocating compute in transformer-based language models
di: Raposo, David, et al.
Pubblicazione: (2024)
di: Raposo, David, et al.
Pubblicazione: (2024)
Anchor function: a type of benchmark functions for studying language models
di: Zhang, Zhongwang, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwang, et al.
Pubblicazione: (2024)
Only relative ranks matter in weight-clustered large language models
di: Aizpurua, Borja, et al.
Pubblicazione: (2026)
di: Aizpurua, Borja, et al.
Pubblicazione: (2026)
Simple linear attention language models balance the recall-throughput tradeoff
di: Arora, Simran, et al.
Pubblicazione: (2024)
di: Arora, Simran, et al.
Pubblicazione: (2024)
How do language models learn facts? Dynamics, curricula and hallucinations
di: Zucchet, Nicolas, et al.
Pubblicazione: (2025)
di: Zucchet, Nicolas, et al.
Pubblicazione: (2025)
Just read twice: closing the recall gap for recurrent language models
di: Arora, Simran, et al.
Pubblicazione: (2024)
di: Arora, Simran, et al.
Pubblicazione: (2024)
Large Language Models as Model Organisms for Human Associative Learning
di: Kolling, Camila, et al.
Pubblicazione: (2025)
di: Kolling, Camila, et al.
Pubblicazione: (2025)
Representation in large language models
di: Yetman, Cameron
Pubblicazione: (2025)
di: Yetman, Cameron
Pubblicazione: (2025)
Question answering system of bridge design specification based on large language model
di: Zhang, Leye, et al.
Pubblicazione: (2024)
di: Zhang, Leye, et al.
Pubblicazione: (2024)
Linear representations in language models can change dramatically over a conversation
di: Lampinen, Andrew Kyle, et al.
Pubblicazione: (2026)
di: Lampinen, Andrew Kyle, et al.
Pubblicazione: (2026)
DataComp-LM: In search of the next generation of training sets for language models
di: Li, Jeffrey, et al.
Pubblicazione: (2024)
di: Li, Jeffrey, et al.
Pubblicazione: (2024)
B-score: Detecting biases in large language models using response history
di: Vo, An, et al.
Pubblicazione: (2025)
di: Vo, An, et al.
Pubblicazione: (2025)
The SMeL Test: A simple benchmark for media literacy in language models
di: Ahdritz, Gustaf, et al.
Pubblicazione: (2025)
di: Ahdritz, Gustaf, et al.
Pubblicazione: (2025)
The representation landscape of few-shot learning and fine-tuning in large language models
di: Doimo, Diego, et al.
Pubblicazione: (2024)
di: Doimo, Diego, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Tracking Equivalent Mechanistic Interpretations Across Neural Networks
di: Sun, Alan, et al.
Pubblicazione: (2026) -
Speech language models lack important brain-relevant semantics
di: Oota, Subba Reddy, et al.
Pubblicazione: (2023) -
Language models and brains align due to more than next-word prediction and word-level information
di: Merlin, Gabriele, et al.
Pubblicazione: (2022) -
Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
di: Moussa, Omer, et al.
Pubblicazione: (2025) -
When Language Models Lose Their Mind: The Consequences of Brain Misalignment
di: Merlin, Gabriele, et al.
Pubblicazione: (2026)