Automated Interpretability and Feature Discovery in Language Models with Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Marin-Llobet, Arnau, Ferrando, Javier |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vision-Language Models Suppress Female Representations Under Ambiguous Input
by: Marin-Llobet, Arnau, et al.
Published: (2026)
by: Marin-Llobet, Arnau, et al.
Published: (2026)
ChatVis: Automating Scientific Visualization with a Large Language Model
by: Mallick, Tanwi, et al.
Published: (2024)
by: Mallick, Tanwi, et al.
Published: (2024)
SymbolicThought: Integrating Language Models and Symbolic Reasoning for Consistent and Interpretable Human Relationship Understanding
by: Zhao, Runcong, et al.
Published: (2025)
by: Zhao, Runcong, et al.
Published: (2025)
Large Language Model-Brained GUI Agents: A Survey
by: Zhang, Chaoyun, et al.
Published: (2024)
by: Zhang, Chaoyun, et al.
Published: (2024)
A Survey of Large Language Model Agents for Question Answering
by: Yue, Murong
Published: (2025)
by: Yue, Murong
Published: (2025)
ChatSUMO: Large Language Model for Automating Traffic Scenario Generation in Simulation of Urban MObility
by: Li, Shuyang, et al.
Published: (2024)
by: Li, Shuyang, et al.
Published: (2024)
Can Large Language Model Agents Simulate Human Trust Behavior?
by: Xie, Chengxing, et al.
Published: (2024)
by: Xie, Chengxing, et al.
Published: (2024)
VeriLA: A Human-Centered Evaluation Framework for Interpretable Verification of LLM Agent Failures
by: Sung, Yoo Yeon, et al.
Published: (2025)
by: Sung, Yoo Yeon, et al.
Published: (2025)
On the Reliability of Large Language Models to Misinformed and Demographically-Informed Prompts
by: Aremu, Toluwani, et al.
Published: (2024)
by: Aremu, Toluwani, et al.
Published: (2024)
Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends
by: Wang, Ye, et al.
Published: (2026)
by: Wang, Ye, et al.
Published: (2026)
Actions Speak Louder than Words: Agent Decisions Reveal Implicit Biases in Language Models
by: Li, Yuxuan, et al.
Published: (2025)
by: Li, Yuxuan, et al.
Published: (2025)
Tell Me More! Towards Implicit User Intention Understanding of Language Model Driven Agents
by: Qian, Cheng, et al.
Published: (2024)
by: Qian, Cheng, et al.
Published: (2024)
Improving Interactive Diagnostic Ability of a Large Language Model Agent Through Clinical Experience Learning
by: Sun, Zhoujian, et al.
Published: (2025)
by: Sun, Zhoujian, et al.
Published: (2025)
Towards Automated Error Discovery: A Study in Conversational AI
by: Petrak, Dominic, et al.
Published: (2025)
by: Petrak, Dominic, et al.
Published: (2025)
ReSpAct: Harmonizing Reasoning, Speaking, and Acting Towards Building Large Language Model-Based Conversational AI Agents
by: Dongre, Vardhan, et al.
Published: (2024)
by: Dongre, Vardhan, et al.
Published: (2024)
A Scalable Framework for Evaluating Health Language Models
by: Mallinar, Neil, et al.
Published: (2025)
by: Mallinar, Neil, et al.
Published: (2025)
Transforming Tuberculosis Care: Optimizing Large Language Models For Enhanced Clinician-Patient Communication
by: Filienko, Daniil, et al.
Published: (2025)
by: Filienko, Daniil, et al.
Published: (2025)
Advancing AI-Scientist Understanding: Multi-Agent LLMs with Interpretable Physics Reasoning
by: Xu, Yinggan, et al.
Published: (2025)
by: Xu, Yinggan, et al.
Published: (2025)
Large Language Model-Powered Conversational Agent Delivering Problem-Solving Therapy (PST) for Family Caregivers: Enhancing Empathy and Therapeutic Alliance Using In-Context Learning
by: Wang, Liying, et al.
Published: (2025)
by: Wang, Liying, et al.
Published: (2025)
Causal Discovery and Counterfactual Reasoning to Optimize Persuasive Dialogue Policies
by: Zeng, Donghuo, et al.
Published: (2025)
by: Zeng, Donghuo, et al.
Published: (2025)
IRIS: Interactive Research Ideation System for Accelerating Scientific Discovery
by: Garikaparthi, Aniketh, et al.
Published: (2025)
by: Garikaparthi, Aniketh, et al.
Published: (2025)
Status Hierarchies in Language Models
by: Barkett, Emilio
Published: (2026)
by: Barkett, Emilio
Published: (2026)
Generative Interfaces for Language Models
by: Chen, Jiaqi, et al.
Published: (2025)
by: Chen, Jiaqi, et al.
Published: (2025)
Offscript: Automated Auditing of Instruction Adherence in LLMs
by: Clark, Nicholas, et al.
Published: (2025)
by: Clark, Nicholas, et al.
Published: (2025)
Epistemic Integrity in Large Language Models
by: Ghafouri, Bijean, et al.
Published: (2024)
by: Ghafouri, Bijean, et al.
Published: (2024)
An Evaluation of Estimative Uncertainty in Large Language Models
by: Tang, Zhisheng, et al.
Published: (2024)
by: Tang, Zhisheng, et al.
Published: (2024)
Evaluating the Prompt Steerability of Large Language Models
by: Miehling, Erik, et al.
Published: (2024)
by: Miehling, Erik, et al.
Published: (2024)
The Art of Saying No: Contextual Noncompliance in Language Models
by: Brahman, Faeze, et al.
Published: (2024)
by: Brahman, Faeze, et al.
Published: (2024)
Autonomous Prompt Engineering in Large Language Models
by: Kepel, Daan, et al.
Published: (2024)
by: Kepel, Daan, et al.
Published: (2024)
Accounting for Sycophancy in Language Model Uncertainty Estimation
by: Sicilia, Anthony, et al.
Published: (2024)
by: Sicilia, Anthony, et al.
Published: (2024)
Multi-agent KTO: Reinforcing Strategic Interactions of Large Language Model in Language Game
by: Ye, Rong, et al.
Published: (2025)
by: Ye, Rong, et al.
Published: (2025)
Prompt2DeModel: Declarative Neuro-Symbolic Modeling with Natural Language
by: Faghihi, Hossein Rajaby, et al.
Published: (2024)
by: Faghihi, Hossein Rajaby, et al.
Published: (2024)
Inertia in Moral and Value Judgments of Large Language Models
by: Lee, Bruce W., et al.
Published: (2024)
by: Lee, Bruce W., et al.
Published: (2024)
Large Language Model Use Impact Locus of Control
by: Fu, Jenny Xiyu, et al.
Published: (2025)
by: Fu, Jenny Xiyu, et al.
Published: (2025)
Large Language Models and Games: A Survey and Roadmap
by: Gallotta, Roberto, et al.
Published: (2024)
by: Gallotta, Roberto, et al.
Published: (2024)
(Ir)rationality and Cognitive Biases in Large Language Models
by: Macmillan-Scott, Olivia, et al.
Published: (2024)
by: Macmillan-Scott, Olivia, et al.
Published: (2024)
Empowering Private Tutoring by Chaining Large Language Models
by: Chen, Yulin, et al.
Published: (2023)
by: Chen, Yulin, et al.
Published: (2023)
Evaluating Large Language Models in Analysing Classroom Dialogue
by: Long, Yun, et al.
Published: (2024)
by: Long, Yun, et al.
Published: (2024)
AI Telephone Surveying: Automating Quantitative Data Collection with an AI Interviewer
by: Leybzon, Danny D., et al.
Published: (2025)
by: Leybzon, Danny D., et al.
Published: (2025)
The Automated but Risky Game: Modeling and Benchmarking Agent-to-Agent Negotiations and Transactions in Consumer Markets
by: Zhu, Shenzhe, et al.
Published: (2025)
by: Zhu, Shenzhe, et al.
Published: (2025)
Similar Items
-
Vision-Language Models Suppress Female Representations Under Ambiguous Input
by: Marin-Llobet, Arnau, et al.
Published: (2026) -
ChatVis: Automating Scientific Visualization with a Large Language Model
by: Mallick, Tanwi, et al.
Published: (2024) -
SymbolicThought: Integrating Language Models and Symbolic Reasoning for Consistent and Interpretable Human Relationship Understanding
by: Zhao, Runcong, et al.
Published: (2025) -
Large Language Model-Brained GUI Agents: A Survey
by: Zhang, Chaoyun, et al.
Published: (2024) -
A Survey of Large Language Model Agents for Question Answering
by: Yue, Murong
Published: (2025)