Distributed Interpretability and Control for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Desai, Dev Arpan, Huang, Shaoyi, Zhu, Zining |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts
di: Bhargav, Samaksh, et al.
Pubblicazione: (2025)
di: Bhargav, Samaksh, et al.
Pubblicazione: (2025)
Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models
di: Pawar, Pranav, et al.
Pubblicazione: (2025)
di: Pawar, Pranav, et al.
Pubblicazione: (2025)
Using Large Language Models for Hyperparameter Optimization
di: Zhang, Michael R., et al.
Pubblicazione: (2023)
di: Zhang, Michael R., et al.
Pubblicazione: (2023)
The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models
di: Wang, Yan, et al.
Pubblicazione: (2026)
di: Wang, Yan, et al.
Pubblicazione: (2026)
Interpretable Robot Control via Structured Behavior Trees and Large Language Models
di: Chekam, Ingrid Maéva, et al.
Pubblicazione: (2025)
di: Chekam, Ingrid Maéva, et al.
Pubblicazione: (2025)
An Interpretable and Scalable Framework for Evaluating Large Language Models
di: Qu, Xinhao, et al.
Pubblicazione: (2026)
di: Qu, Xinhao, et al.
Pubblicazione: (2026)
Medical Interpretability and Knowledge Maps of Large Language Models
di: Marinescu, Razvan, et al.
Pubblicazione: (2025)
di: Marinescu, Razvan, et al.
Pubblicazione: (2025)
ToMA: Token Merge with Attention for Diffusion Models
di: Lu, Wenbo, et al.
Pubblicazione: (2025)
di: Lu, Wenbo, et al.
Pubblicazione: (2025)
What Would You Ask When You First Saw $a^2+b^2=c^2$? Evaluating LLM on Curiosity-Driven Questioning
di: Javaji, Shashidhar Reddy, et al.
Pubblicazione: (2024)
di: Javaji, Shashidhar Reddy, et al.
Pubblicazione: (2024)
Plug and Play with Prompts: A Prompt Tuning Approach for Controlling Text Generation
di: Ajwani, Rohan Deepak, et al.
Pubblicazione: (2024)
di: Ajwani, Rohan Deepak, et al.
Pubblicazione: (2024)
Model-Distributed Inference for Large Language Models at the Edge
di: Macario, Davide, et al.
Pubblicazione: (2025)
di: Macario, Davide, et al.
Pubblicazione: (2025)
InverseScope: Scalable Activation Inversion for Interpreting Large Language Models
di: Luo, Yifan, et al.
Pubblicazione: (2025)
di: Luo, Yifan, et al.
Pubblicazione: (2025)
Evidence-based Distributional Alignment for Large Language Models
di: Pham, Viet-Thanh, et al.
Pubblicazione: (2026)
di: Pham, Viet-Thanh, et al.
Pubblicazione: (2026)
REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model
di: Li, Bo, et al.
Pubblicazione: (2025)
di: Li, Bo, et al.
Pubblicazione: (2025)
Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models
di: Winninger, Thomas, et al.
Pubblicazione: (2025)
di: Winninger, Thomas, et al.
Pubblicazione: (2025)
Rethinking Interpretability in the Era of Large Language Models
di: Singh, Chandan, et al.
Pubblicazione: (2024)
di: Singh, Chandan, et al.
Pubblicazione: (2024)
RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs
di: Zhou, Runlong, et al.
Pubblicazione: (2025)
di: Zhou, Runlong, et al.
Pubblicazione: (2025)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
Larimar: Large Language Models with Episodic Memory Control
di: Das, Payel, et al.
Pubblicazione: (2024)
di: Das, Payel, et al.
Pubblicazione: (2024)
PALADIN: Self-Correcting Language Model Agents to Cure Tool-Failure Cases
di: Vuddanti, Sri Vatsa, et al.
Pubblicazione: (2025)
di: Vuddanti, Sri Vatsa, et al.
Pubblicazione: (2025)
A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
Epidemiology of Large Language Models: A Benchmark for Observational Distribution Knowledge
di: Plecko, Drago, et al.
Pubblicazione: (2025)
di: Plecko, Drago, et al.
Pubblicazione: (2025)
Large Language Model Predicts Above Normal All India Summer Monsoon Rainfall in 2024
di: Sharma, Ujjawal, et al.
Pubblicazione: (2024)
di: Sharma, Ujjawal, et al.
Pubblicazione: (2024)
Inverse Reinforcement Learning With Constraint Recovery
di: Das, Nirjhar, et al.
Pubblicazione: (2023)
di: Das, Nirjhar, et al.
Pubblicazione: (2023)
Robust Multi-Objective Controlled Decoding of Large Language Models
di: Son, Seongho, et al.
Pubblicazione: (2025)
di: Son, Seongho, et al.
Pubblicazione: (2025)
GSR-GNN: Training Acceleration and Memory-Saving Framework of Deep GNNs on Circuit Graph
di: Luo, Yuebo, et al.
Pubblicazione: (2026)
di: Luo, Yuebo, et al.
Pubblicazione: (2026)
SelfIE: Self-Interpretation of Large Language Model Embeddings
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
TracrBench: Generating Interpretability Testbeds with Large Language Models
di: Thurnherr, Hannes, et al.
Pubblicazione: (2024)
di: Thurnherr, Hannes, et al.
Pubblicazione: (2024)
Fine-Grained Interpretation of Political Opinions in Large Language Models
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
Unlocking Emergent Modularity in Large Language Models
di: Qiu, Zihan, et al.
Pubblicazione: (2023)
di: Qiu, Zihan, et al.
Pubblicazione: (2023)
Llamba: Scaling Distilled Recurrent Models for Efficient Language Processing
di: Bick, Aviv, et al.
Pubblicazione: (2025)
di: Bick, Aviv, et al.
Pubblicazione: (2025)
Zero-Space Cost Fault Tolerance for Transformer-based Language Models on ReRAM
di: Li, Bingbing, et al.
Pubblicazione: (2024)
di: Li, Bingbing, et al.
Pubblicazione: (2024)
From Narratives to Probabilistic Reasoning: Predicting and Interpreting Drivers' Hazardous Actions in Crashes Using Large Language Model
di: Chen, Boyou, et al.
Pubblicazione: (2025)
di: Chen, Boyou, et al.
Pubblicazione: (2025)
Tequila: Trapping-free Ternary Quantization for Large Language Models
di: Huang, Hong, et al.
Pubblicazione: (2025)
di: Huang, Hong, et al.
Pubblicazione: (2025)
Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models
di: Sun, Shaoning, et al.
Pubblicazione: (2026)
di: Sun, Shaoning, et al.
Pubblicazione: (2026)
Finding Interpretable Prompt-Specific Circuits in Language Models
di: Franco, Gabriel, et al.
Pubblicazione: (2026)
di: Franco, Gabriel, et al.
Pubblicazione: (2026)
Doubly Robust Alignment for Large Language Models
di: Xu, Erhan, et al.
Pubblicazione: (2025)
di: Xu, Erhan, et al.
Pubblicazione: (2025)
Are Large Language Models In-Context Graph Learners?
di: Li, Jintang, et al.
Pubblicazione: (2025)
di: Li, Jintang, et al.
Pubblicazione: (2025)
A Hierarchical Language Model For Interpretable Graph Reasoning
di: Khurana, Sambhav, et al.
Pubblicazione: (2024)
di: Khurana, Sambhav, et al.
Pubblicazione: (2024)
Interpreting Language Reward Models via Contrastive Explanations
di: Jiang, Junqi, et al.
Pubblicazione: (2024)
di: Jiang, Junqi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts
di: Bhargav, Samaksh, et al.
Pubblicazione: (2025) -
Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models
di: Pawar, Pranav, et al.
Pubblicazione: (2025) -
Using Large Language Models for Hyperparameter Optimization
di: Zhang, Michael R., et al.
Pubblicazione: (2023) -
The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models
di: Wang, Yan, et al.
Pubblicazione: (2026) -
Interpretable Robot Control via Structured Behavior Trees and Large Language Models
di: Chekam, Ingrid Maéva, et al.
Pubblicazione: (2025)