Transformer Dynamics: A neuroscientific approach to interpretability of large language models
Fuente:
arXiv
Guardado en:
| Autores principales: | Fernando, Jesseba, Guitchounts, Grigori |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dynamics of the Transformer Residual Stream: Coupling Spectral Geometry to Network Topology
por: Fernando, Jesseba, et al.
Publicado: (2026)
por: Fernando, Jesseba, et al.
Publicado: (2026)
Ploutos: Towards interpretable stock movement prediction with financial large language model
por: Tong, Hanshuang, et al.
Publicado: (2024)
por: Tong, Hanshuang, et al.
Publicado: (2024)
CXR-LLAVA: a multimodal large language model for interpreting chest X-ray images
por: Lee, Seowoo, et al.
Publicado: (2023)
por: Lee, Seowoo, et al.
Publicado: (2023)
Georeferencing complex relative locality descriptions with large language models
por: Fernando, Aneesha, et al.
Publicado: (2025)
por: Fernando, Aneesha, et al.
Publicado: (2025)
The wall confronting large language models
por: Coveney, Peter V., et al.
Publicado: (2025)
por: Coveney, Peter V., et al.
Publicado: (2025)
Unsupervised decoding of encoded reasoning using language model interpretability
por: Fang, Ching, et al.
Publicado: (2025)
por: Fang, Ching, et al.
Publicado: (2025)
Generics in science communication: Misaligned interpretations across laypeople, scientists, and large language models
por: Peters, Uwe, et al.
Publicado: (2026)
por: Peters, Uwe, et al.
Publicado: (2026)
Dissociating language and thought in large language models
por: Mahowald, Kyle, et al.
Publicado: (2023)
por: Mahowald, Kyle, et al.
Publicado: (2023)
A thorough benchmark of automatic text classification: From traditional approaches to large language models
por: Cunha, Washington, et al.
Publicado: (2025)
por: Cunha, Washington, et al.
Publicado: (2025)
A critical review of methods and challenges in large language models
por: Moradi, Milad, et al.
Publicado: (2024)
por: Moradi, Milad, et al.
Publicado: (2024)
On the attribution of confidence to large language models
por: Keeling, Geoff, et al.
Publicado: (2024)
por: Keeling, Geoff, et al.
Publicado: (2024)
The challenge of uncertainty quantification of large language models in medicine
por: Atf, Zahra, et al.
Publicado: (2025)
por: Atf, Zahra, et al.
Publicado: (2025)
Domain adaptation of large language models for geotechnical applications
por: Fan, Lei, et al.
Publicado: (2025)
por: Fan, Lei, et al.
Publicado: (2025)
Chain-of-Authorization: Embedding authorization into large language models
por: Li, Yang, et al.
Publicado: (2026)
por: Li, Yang, et al.
Publicado: (2026)
Cognitive models can reveal interpretable value trade-offs in language models
por: Murthy, Sonia K., et al.
Publicado: (2025)
por: Murthy, Sonia K., et al.
Publicado: (2025)
Representation in large language models
por: Yetman, Cameron
Publicado: (2025)
por: Yetman, Cameron
Publicado: (2025)
EvoOpt-LLM: Evolving industrial optimization models with large language models
por: He, Yiliu, et al.
Publicado: (2026)
por: He, Yiliu, et al.
Publicado: (2026)
How large language models judge and influence human cooperation
por: Pires, Alexandre S., et al.
Publicado: (2025)
por: Pires, Alexandre S., et al.
Publicado: (2025)
Mechanistic interpretability of large language models with applications to the financial services industry
por: Golgoon, Ashkan, et al.
Publicado: (2024)
por: Golgoon, Ashkan, et al.
Publicado: (2024)
BadEdit: Backdooring large language models by model editing
por: Li, Yanzhou, et al.
Publicado: (2024)
por: Li, Yanzhou, et al.
Publicado: (2024)
A review on the use of large language models as virtual tutors
por: García-Méndez, Silvia, et al.
Publicado: (2024)
por: García-Méndez, Silvia, et al.
Publicado: (2024)
Optimizing watermarks for large language models
por: Wouters, Bram
Publicado: (2023)
por: Wouters, Bram
Publicado: (2023)
Alignment faking in large language models
por: Greenblatt, Ryan, et al.
Publicado: (2024)
por: Greenblatt, Ryan, et al.
Publicado: (2024)
A survey of textual cyber abuse detection using cutting-edge language models and large language models
por: Diaz-Garcia, Jose A., et al.
Publicado: (2025)
por: Diaz-Garcia, Jose A., et al.
Publicado: (2025)
\(X\)-evolve: Solution space evolution powered by large language models
por: Zhai, Yi, et al.
Publicado: (2025)
por: Zhai, Yi, et al.
Publicado: (2025)
Benchmarking graph construction by large language models for coherence-driven inference
por: Huntsman, Steve, et al.
Publicado: (2025)
por: Huntsman, Steve, et al.
Publicado: (2025)
SemPool: Simple, robust, and interpretable KG pooling for enhancing language models
por: Mavromatis, Costas, et al.
Publicado: (2024)
por: Mavromatis, Costas, et al.
Publicado: (2024)
MoleCode unlocks structural intelligence in large language models
por: Yan, Zhiyuan, et al.
Publicado: (2026)
por: Yan, Zhiyuan, et al.
Publicado: (2026)
Quantifying non deterministic drift in large language models
por: Nicholson, Claire
Publicado: (2026)
por: Nicholson, Claire
Publicado: (2026)
Can large language models build causal graphs?
por: Long, Stephanie, et al.
Publicado: (2023)
por: Long, Stephanie, et al.
Publicado: (2023)
Quantifying construct validity in large language model evaluations
por: Kearns, Ryan Othniel
Publicado: (2026)
por: Kearns, Ryan Othniel
Publicado: (2026)
Multi-round jailbreak attack on large language models
por: Zhou, Yihua, et al.
Publicado: (2024)
por: Zhou, Yihua, et al.
Publicado: (2024)
Response: Emergent analogical reasoning in large language models
por: Hodel, Damian, et al.
Publicado: (2023)
por: Hodel, Damian, et al.
Publicado: (2023)
The 20 questions game to distinguish large language models
por: Richardeau, Gurvan, et al.
Publicado: (2024)
por: Richardeau, Gurvan, et al.
Publicado: (2024)
AI-AI Bias: large language models favor communications generated by large language models
por: Laurito, Walter, et al.
Publicado: (2024)
por: Laurito, Walter, et al.
Publicado: (2024)
Ranking protein-protein models with large language models and graph neural networks
por: Xu, Xiaotong, et al.
Publicado: (2024)
por: Xu, Xiaotong, et al.
Publicado: (2024)
Retrieval-augmented in-context learning for multimodal large language models in disease classification
por: Zhan, Zaifu, et al.
Publicado: (2025)
por: Zhan, Zaifu, et al.
Publicado: (2025)
Toward a unified framework for data-efficient evaluation of large language models
por: Liao, Lele, et al.
Publicado: (2025)
por: Liao, Lele, et al.
Publicado: (2025)
A blind spot for large language models: Supradiegetic linguistic information
por: Zimmerman, Julia Witte, et al.
Publicado: (2023)
por: Zimmerman, Julia Witte, et al.
Publicado: (2023)
Hyacinth6B: A large language model for Traditional Chinese
por: Song, Chih-Wei, et al.
Publicado: (2024)
por: Song, Chih-Wei, et al.
Publicado: (2024)
Ejemplares similares
-
Dynamics of the Transformer Residual Stream: Coupling Spectral Geometry to Network Topology
por: Fernando, Jesseba, et al.
Publicado: (2026) -
Ploutos: Towards interpretable stock movement prediction with financial large language model
por: Tong, Hanshuang, et al.
Publicado: (2024) -
CXR-LLAVA: a multimodal large language model for interpreting chest X-ray images
por: Lee, Seowoo, et al.
Publicado: (2023) -
Georeferencing complex relative locality descriptions with large language models
por: Fernando, Aneesha, et al.
Publicado: (2025) -
The wall confronting large language models
por: Coveney, Peter V., et al.
Publicado: (2025)