Variational Language Concepts for Interpreting Foundation Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Hengyi, Tan, Shiwei, Hong, Zhiqing, Zhang, Desheng, Wang, Hao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Probabilistic Conceptual Explainers: Trustworthy Conceptual Explanations for Vision Foundation Models
por: Wang, Hengyi, et al.
Publicado: (2024)
por: Wang, Hengyi, et al.
Publicado: (2024)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
por: Wang, Hengyi, et al.
Publicado: (2024)
por: Wang, Hengyi, et al.
Publicado: (2024)
Continual Learning of Large Language Models: A Comprehensive Survey
por: Shi, Haizhou, et al.
Publicado: (2024)
por: Shi, Haizhou, et al.
Publicado: (2024)
Cross-Layer Discrete Concept Discovery for Interpreting Language Models
por: Garg, Ankur, et al.
Publicado: (2025)
por: Garg, Ankur, et al.
Publicado: (2025)
Interpreting Language Models Through Concept Descriptions: A Survey
por: Feldhus, Nils, et al.
Publicado: (2025)
por: Feldhus, Nils, et al.
Publicado: (2025)
Causal Decoding for Hallucination-Resistant Multimodal Large Language Models
por: Tan, Shiwei, et al.
Publicado: (2026)
por: Tan, Shiwei, et al.
Publicado: (2026)
Variational Reasoning for Language Models
por: Zhou, Xiangxin, et al.
Publicado: (2025)
por: Zhou, Xiangxin, et al.
Publicado: (2025)
TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
por: Zhang, Tunyu, et al.
Publicado: (2025)
por: Zhang, Tunyu, et al.
Publicado: (2025)
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
por: Muhamed, Aashiq, et al.
Publicado: (2024)
por: Muhamed, Aashiq, et al.
Publicado: (2024)
Latent Concept Disentanglement in Transformer-based Language Models
por: Hong, Guan Zhe, et al.
Publicado: (2025)
por: Hong, Guan Zhe, et al.
Publicado: (2025)
Learning to Interpret Weight Differences in Language Models
por: Goel, Avichal, et al.
Publicado: (2025)
por: Goel, Avichal, et al.
Publicado: (2025)
Apple Intelligence Foundation Language Models
por: Gunter, Tom, et al.
Publicado: (2024)
por: Gunter, Tom, et al.
Publicado: (2024)
Exploring Concept Depth: How Large Language Models Acquire Knowledge and Concept at Different Layers?
por: Jin, Mingyu, et al.
Publicado: (2024)
por: Jin, Mingyu, et al.
Publicado: (2024)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
por: Soo, Samuel, et al.
Publicado: (2025)
por: Soo, Samuel, et al.
Publicado: (2025)
Foundations of Large Language Models
por: Xiao, Tong, et al.
Publicado: (2025)
por: Xiao, Tong, et al.
Publicado: (2025)
Self-Play Preference Optimization for Language Model Alignment
por: Wu, Yue, et al.
Publicado: (2024)
por: Wu, Yue, et al.
Publicado: (2024)
Interpreting Key Mechanisms of Factual Recall in Transformer-Based Language Models
por: Lv, Ang, et al.
Publicado: (2024)
por: Lv, Ang, et al.
Publicado: (2024)
Improving Large Language Models with Concept-Aware Fine-Tuning
por: Chen, Michael K., et al.
Publicado: (2025)
por: Chen, Michael K., et al.
Publicado: (2025)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
por: Zang, Yuan, et al.
Publicado: (2024)
por: Zang, Yuan, et al.
Publicado: (2024)
The Geometry of Categorical and Hierarchical Concepts in Large Language Models
por: Park, Kiho, et al.
Publicado: (2024)
por: Park, Kiho, et al.
Publicado: (2024)
Training-Free Bayesianization for Low-Rank Adapters of Large Language Models
por: Shi, Haizhou, et al.
Publicado: (2024)
por: Shi, Haizhou, et al.
Publicado: (2024)
Rethinking Interpretability in the Era of Large Language Models
por: Singh, Chandan, et al.
Publicado: (2024)
por: Singh, Chandan, et al.
Publicado: (2024)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
por: Wang, Xu, et al.
Publicado: (2026)
por: Wang, Xu, et al.
Publicado: (2026)
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
por: Feng, Xiaohua, et al.
Publicado: (2025)
por: Feng, Xiaohua, et al.
Publicado: (2025)
Recursive Concept Evolution for Compositional Reasoning in Large Language Models
por: Chaudhry, Sarim
Publicado: (2026)
por: Chaudhry, Sarim
Publicado: (2026)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
por: Cho, Hakaze, et al.
Publicado: (2025)
por: Cho, Hakaze, et al.
Publicado: (2025)
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
por: Wang, Qianli, et al.
Publicado: (2024)
por: Wang, Qianli, et al.
Publicado: (2024)
A Survey on Large Language Models from Concept to Implementation
por: Wang, Chen, et al.
Publicado: (2024)
por: Wang, Chen, et al.
Publicado: (2024)
Instruction-tuned Language Models are Better Knowledge Learners
por: Jiang, Zhengbao, et al.
Publicado: (2024)
por: Jiang, Zhengbao, et al.
Publicado: (2024)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
por: Wollschläger, Tom, et al.
Publicado: (2025)
por: Wollschläger, Tom, et al.
Publicado: (2025)
TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation
por: Ezzakri, Anas, et al.
Publicado: (2025)
por: Ezzakri, Anas, et al.
Publicado: (2025)
Variation in Verification: Understanding Verification Dynamics in Large Language Models
por: Zhou, Yefan, et al.
Publicado: (2025)
por: Zhou, Yefan, et al.
Publicado: (2025)
SelfIE: Self-Interpretation of Large Language Model Embeddings
por: Chen, Haozhe, et al.
Publicado: (2024)
por: Chen, Haozhe, et al.
Publicado: (2024)
TracrBench: Generating Interpretability Testbeds with Large Language Models
por: Thurnherr, Hannes, et al.
Publicado: (2024)
por: Thurnherr, Hannes, et al.
Publicado: (2024)
Fine-Grained Interpretation of Political Opinions in Large Language Models
por: Hu, Jingyu, et al.
Publicado: (2025)
por: Hu, Jingyu, et al.
Publicado: (2025)
Superscopes: Amplifying Internal Feature Representations for Language Model Interpretation
por: Jacobi, Jonathan, et al.
Publicado: (2025)
por: Jacobi, Jonathan, et al.
Publicado: (2025)
The Dual-Stream Transformer: Channelized Architecture for Interpretable Language Modeling
por: Kerce, J. Clayton, et al.
Publicado: (2026)
por: Kerce, J. Clayton, et al.
Publicado: (2026)
Atlas-Alignment: Making Interpretability Transferable Across Language Models
por: Puri, Bruno, et al.
Publicado: (2025)
por: Puri, Bruno, et al.
Publicado: (2025)
Skewed Memorization in Large Language Models: Quantification and Decomposition
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
BLoB: Bayesian Low-Rank Adaptation by Backpropagation for Large Language Models
por: Wang, Yibin, et al.
Publicado: (2024)
por: Wang, Yibin, et al.
Publicado: (2024)
Ejemplares similares
-
Probabilistic Conceptual Explainers: Trustworthy Conceptual Explanations for Vision Foundation Models
por: Wang, Hengyi, et al.
Publicado: (2024) -
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
por: Wang, Hengyi, et al.
Publicado: (2024) -
Continual Learning of Large Language Models: A Comprehensive Survey
por: Shi, Haizhou, et al.
Publicado: (2024) -
Cross-Layer Discrete Concept Discovery for Interpreting Language Models
por: Garg, Ankur, et al.
Publicado: (2025) -
Interpreting Language Models Through Concept Descriptions: A Survey
por: Feldhus, Nils, et al.
Publicado: (2025)