Concept Bottleneck Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Chung-En, Oikarinen, Tuomas, Ustun, Berk, Weng, Tsui-Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Crafting Large Language Models for Enhanced Interpretability
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
Interpretable Generative Models through Post-hoc Concept Bottlenecks
di: Kulkarni, Akshay, et al.
Pubblicazione: (2025)
di: Kulkarni, Akshay, et al.
Pubblicazione: (2025)
CI-CBM: Class-Incremental Concept Bottleneck Model for Interpretable Continual Learning
di: Javadi, Amirhosein, et al.
Pubblicazione: (2026)
di: Javadi, Amirhosein, et al.
Pubblicazione: (2026)
Linear Explanations for Individual Neurons
di: Oikarinen, Tuomas, et al.
Pubblicazione: (2024)
di: Oikarinen, Tuomas, et al.
Pubblicazione: (2024)
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
Effective Skill Unlearning through Intervention and Abstention
di: Li, Yongce, et al.
Pubblicazione: (2025)
di: Li, Yongce, et al.
Pubblicazione: (2025)
Evaluating Neuron Explanations: A Unified Framework with Sanity Checks
di: Oikarinen, Tuomas, et al.
Pubblicazione: (2025)
di: Oikarinen, Tuomas, et al.
Pubblicazione: (2025)
Beyond Top Activations: Efficient and Reliable Crowdsourced Evaluation of Automated Interpretability
di: Oikarinen, Tuomas, et al.
Pubblicazione: (2025)
di: Oikarinen, Tuomas, et al.
Pubblicazione: (2025)
Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability
di: Yan, Ge, et al.
Pubblicazione: (2025)
di: Yan, Ge, et al.
Pubblicazione: (2025)
Interpreting Neurons in Deep Vision Networks with Language Models
di: Bai, Nicholas, et al.
Pubblicazione: (2024)
di: Bai, Nicholas, et al.
Pubblicazione: (2024)
VLG-CBM: Training Concept Bottleneck Models with Vision-Language Guidance
di: Srivastava, Divyansh, et al.
Pubblicazione: (2024)
di: Srivastava, Divyansh, et al.
Pubblicazione: (2024)
Prediction without Preclusion: Recourse Verification with Reachable Sets
di: Kothari, Avni, et al.
Pubblicazione: (2023)
di: Kothari, Avni, et al.
Pubblicazione: (2023)
Graph Concept Bottleneck Models
di: Xu, Haotian, et al.
Pubblicazione: (2025)
di: Xu, Haotian, et al.
Pubblicazione: (2025)
Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
di: Tsui, Ken
Pubblicazione: (2025)
di: Tsui, Ken
Pubblicazione: (2025)
Understanding Fixed Predictions via Confined Regions
di: Lawless, Connor, et al.
Pubblicazione: (2025)
di: Lawless, Connor, et al.
Pubblicazione: (2025)
Concept Bottleneck Language Models For protein design
di: Ismail, Aya Abdelsalam, et al.
Pubblicazione: (2024)
di: Ismail, Aya Abdelsalam, et al.
Pubblicazione: (2024)
ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
Interpretable and Steerable Concept Bottleneck Sparse Autoencoders
di: Kulkarni, Akshay, et al.
Pubblicazione: (2025)
di: Kulkarni, Akshay, et al.
Pubblicazione: (2025)
Statistical Inference for Responsiveness Verification
di: Cheon, Seung Hyun, et al.
Pubblicazione: (2025)
di: Cheon, Seung Hyun, et al.
Pubblicazione: (2025)
Breaking the Barrier: Enhanced Utility and Robustness in Smoothed DRL Agents
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
di: Sun, Chung-En, et al.
Pubblicazione: (2024)
Distilling Knowledge from Large Language Models: A Concept Bottleneck Model for Hate and Counter Speech Recognition
di: Labadie-Tamayo, Roberto, et al.
Pubblicazione: (2025)
di: Labadie-Tamayo, Roberto, et al.
Pubblicazione: (2025)
CLUE: Concept-Level Uncertainty Estimation for Large Language Models
di: Wang, Yu-Hsiang, et al.
Pubblicazione: (2024)
di: Wang, Yu-Hsiang, et al.
Pubblicazione: (2024)
ShifaMind: A Multiplicative Concept Bottleneck for Interpretable ICD-10 Coding
di: Syed, Mohammed Sameer, et al.
Pubblicazione: (2026)
di: Syed, Mohammed Sameer, et al.
Pubblicazione: (2026)
Steer2Edit: From Activation Steering to Component-Level Editing
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
di: Sun, Chung-En, et al.
Pubblicazione: (2026)
Modifying Large Language Model Post-Training for Diverse Creative Writing
di: Chung, John Joon Young, et al.
Pubblicazione: (2025)
di: Chung, John Joon Young, et al.
Pubblicazione: (2025)
Analogical Reasoning Inside Large Language Models: Concept Vectors and the Limits of Abstraction
di: Opiełka, Gustaw, et al.
Pubblicazione: (2025)
di: Opiełka, Gustaw, et al.
Pubblicazione: (2025)
Concept Unlearning in Large Language Models via Self-Constructed Knowledge Triplets
di: Yamashita, Tomoya, et al.
Pubblicazione: (2025)
di: Yamashita, Tomoya, et al.
Pubblicazione: (2025)
Navigating the Landscape of Large Language Models: A Comprehensive Review and Analysis of Paradigms and Fine-Tuning Strategies
di: Weng, Benjue
Pubblicazione: (2024)
di: Weng, Benjue
Pubblicazione: (2024)
Language Bottleneck Models for Qualitative Knowledge State Modeling
di: Berthon, Antonin, et al.
Pubblicazione: (2025)
di: Berthon, Antonin, et al.
Pubblicazione: (2025)
The Geometry of Categorical and Hierarchical Concepts in Large Language Models
di: Park, Kiho, et al.
Pubblicazione: (2024)
di: Park, Kiho, et al.
Pubblicazione: (2024)
Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models
di: Zhang, Yang, et al.
Pubblicazione: (2025)
di: Zhang, Yang, et al.
Pubblicazione: (2025)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
Robust Training of Vector Quantized Bottleneck Models
di: Łańcucki, Adrian, et al.
Pubblicazione: (2020)
di: Łańcucki, Adrian, et al.
Pubblicazione: (2020)
Exploring Concept Depth: How Large Language Models Acquire Knowledge and Concept at Different Layers?
di: Jin, Mingyu, et al.
Pubblicazione: (2024)
di: Jin, Mingyu, et al.
Pubblicazione: (2024)
Recursive Concept Evolution for Compositional Reasoning in Large Language Models
di: Chaudhry, Sarim
Pubblicazione: (2026)
di: Chaudhry, Sarim
Pubblicazione: (2026)
Improving Large Language Models with Concept-Aware Fine-Tuning
di: Chen, Michael K., et al.
Pubblicazione: (2025)
di: Chen, Michael K., et al.
Pubblicazione: (2025)
DFA-RAG: Conversational Semantic Router for Large Language Model with Definite Finite Automaton
di: Sun, Yiyou, et al.
Pubblicazione: (2024)
di: Sun, Yiyou, et al.
Pubblicazione: (2024)
Breaking the Attention Bottleneck
di: Hilsenbek, Kalle
Pubblicazione: (2024)
di: Hilsenbek, Kalle
Pubblicazione: (2024)
Policy Learning with a Language Bottleneck
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Crafting Large Language Models for Enhanced Interpretability
di: Sun, Chung-En, et al.
Pubblicazione: (2024) -
Interpretable Generative Models through Post-hoc Concept Bottlenecks
di: Kulkarni, Akshay, et al.
Pubblicazione: (2025) -
CI-CBM: Class-Incremental Concept Bottleneck Model for Interpretable Continual Learning
di: Javadi, Amirhosein, et al.
Pubblicazione: (2026) -
Linear Explanations for Individual Neurons
di: Oikarinen, Tuomas, et al.
Pubblicazione: (2024) -
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
di: Sun, Chung-En, et al.
Pubblicazione: (2025)