Interpreting Multi-Attribute Confounding through Numerical Attributes in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Takagi, Hirohane, Minegishi, Gouki, Kizawa, Shota, Sukeda, Issey, Yanaka, Hitomi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Topology of Reasoning: Understanding Large Reasoning Models through Reasoning Graph Properties
di: Minegishi, Gouki, et al.
Pubblicazione: (2025)
di: Minegishi, Gouki, et al.
Pubblicazione: (2025)
Towards Empirical Interpretation of Internal Circuits and Properties in Grokked Transformers on Modular Polynomials
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
di: Matsutani, Kohsei, et al.
Pubblicazione: (2025)
di: Matsutani, Kohsei, et al.
Pubblicazione: (2025)
Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words
di: Minegishi, Gouki, et al.
Pubblicazione: (2025)
di: Minegishi, Gouki, et al.
Pubblicazione: (2025)
Development and bilingual evaluation of Japanese medical large language model within reasonably low computational resources
di: Sukeda, Issey
Pubblicazione: (2024)
di: Sukeda, Issey
Pubblicazione: (2024)
Safe Transformer: An Explicit Safety Bit For Interpretable And Controllable Alignment
di: Feng, Jingyuan, et al.
Pubblicazione: (2026)
di: Feng, Jingyuan, et al.
Pubblicazione: (2026)
Beyond Induction Heads: In-Context Meta Learning Induces Multi-Phase Circuit Emergence
di: Minegishi, Gouki, et al.
Pubblicazione: (2025)
di: Minegishi, Gouki, et al.
Pubblicazione: (2025)
Mechanism of Task-oriented Information Removal in In-context Learning
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
Understanding Emergent Misalignment via Feature Superposition Geometry
di: Minegishi, Gouki, et al.
Pubblicazione: (2026)
di: Minegishi, Gouki, et al.
Pubblicazione: (2026)
Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training
di: Matsutani, Kohsei, et al.
Pubblicazione: (2026)
di: Matsutani, Kohsei, et al.
Pubblicazione: (2026)
Attribution Bias in Large Language Models
di: Berman, Eliza, et al.
Pubblicazione: (2026)
di: Berman, Eliza, et al.
Pubblicazione: (2026)
Advancing Large Language Model Attribution through Self-Improving
di: Huang, Lei, et al.
Pubblicazione: (2024)
di: Huang, Lei, et al.
Pubblicazione: (2024)
Steering at the Source: Style Modulation Heads for Robust Persona Control
di: Izawa, Yoshihiro, et al.
Pubblicazione: (2026)
di: Izawa, Yoshihiro, et al.
Pubblicazione: (2026)
Analyzing Memorization in Large Language Models through the Lens of Model Attribution
di: Menta, Tarun Ram, et al.
Pubblicazione: (2025)
di: Menta, Tarun Ram, et al.
Pubblicazione: (2025)
Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models
di: Jiang, Xinyan, et al.
Pubblicazione: (2025)
di: Jiang, Xinyan, et al.
Pubblicazione: (2025)
Minimum information Markov model
di: Sukeda, Issey, et al.
Pubblicazione: (2026)
di: Sukeda, Issey, et al.
Pubblicazione: (2026)
Frank copula is minimum information copula under fixed Kendall's $τ$
di: Sukeda, Issey, et al.
Pubblicazione: (2024)
di: Sukeda, Issey, et al.
Pubblicazione: (2024)
Relative local dependence of bivariate copulas
di: Sukeda, Issey, et al.
Pubblicazione: (2024)
di: Sukeda, Issey, et al.
Pubblicazione: (2024)
On the minimum information checkerboard copulas under fixed Kendall's rank correlation
di: Sukeda, Issey, et al.
Pubblicazione: (2023)
di: Sukeda, Issey, et al.
Pubblicazione: (2023)
DataDignity: Training Data Attribution for Large Language Models
di: Li, Xiaomin, et al.
Pubblicazione: (2026)
di: Li, Xiaomin, et al.
Pubblicazione: (2026)
Intersectional Bias in Japanese Large Language Models from a Contextualized Perspective
di: Yanaka, Hitomi, et al.
Pubblicazione: (2025)
di: Yanaka, Hitomi, et al.
Pubblicazione: (2025)
Multi-Attribute Constraint Satisfaction via Language Model Rewriting
di: Baheti, Ashutosh, et al.
Pubblicazione: (2024)
di: Baheti, Ashutosh, et al.
Pubblicazione: (2024)
Source Attribution for Large Language Model-Generated Data
di: Wang, Jingtan, et al.
Pubblicazione: (2023)
di: Wang, Jingtan, et al.
Pubblicazione: (2023)
Exploring the Role of Knowledge Graph-Based RAG in Japanese Medical Question Answering with Small-Scale LLMs
di: Chen, Yingjian, et al.
Pubblicazione: (2025)
di: Chen, Yingjian, et al.
Pubblicazione: (2025)
Noiser: Bounded Input Perturbations for Attributing Large Language Models
di: Madani, Mohammad Reza Ghasemi, et al.
Pubblicazione: (2025)
di: Madani, Mohammad Reza Ghasemi, et al.
Pubblicazione: (2025)
Explaining the Reasoning of Large Language Models Using Attribution Graphs
di: Walker, Chase, et al.
Pubblicazione: (2025)
di: Walker, Chase, et al.
Pubblicazione: (2025)
Learning to Price: Interpretable Attribute-Level Models for Dynamic Markets
di: Sethuraman, Srividhya, et al.
Pubblicazione: (2026)
di: Sethuraman, Srividhya, et al.
Pubblicazione: (2026)
Enhancing Model Interpretability with Local Attribution over Global Exploration
di: Zhu, Zhiyu, et al.
Pubblicazione: (2024)
di: Zhu, Zhiyu, et al.
Pubblicazione: (2024)
AIM: Attributing, Interpreting, Mitigating Data Unfairness
di: Liu, Zhining, et al.
Pubblicazione: (2024)
di: Liu, Zhining, et al.
Pubblicazione: (2024)
Attributions All the Way Down? The Metagame of Interpretability
di: Baniecki, Hubert, et al.
Pubblicazione: (2026)
di: Baniecki, Hubert, et al.
Pubblicazione: (2026)
Attribute Based Interpretable Evaluation Metrics for Generative Models
di: Kim, Dongkyun, et al.
Pubblicazione: (2023)
di: Kim, Dongkyun, et al.
Pubblicazione: (2023)
Document Attribution: Examining Citation Relationships using Large Language Models
di: Rawte, Vipula, et al.
Pubblicazione: (2025)
di: Rawte, Vipula, et al.
Pubblicazione: (2025)
Revisiting Large Language Model Pruning using Neuron Semantic Attribution
di: Ding, Yizhuo, et al.
Pubblicazione: (2025)
di: Ding, Yizhuo, et al.
Pubblicazione: (2025)
Learning Fine-Grained Grounded Citations for Attributed Large Language Models
di: Huang, Lei, et al.
Pubblicazione: (2024)
di: Huang, Lei, et al.
Pubblicazione: (2024)
Mitigating Hidden Confounding by Progressive Confounder Imputation via Large Language Models
di: Yang, Hao, et al.
Pubblicazione: (2025)
di: Yang, Hao, et al.
Pubblicazione: (2025)
Large Language Models as Attribution Regularizers for Efficient Model Training
di: Vukadin, Davor, et al.
Pubblicazione: (2025)
di: Vukadin, Davor, et al.
Pubblicazione: (2025)
A Monosemantic Attribution Framework for Stable Interpretability in Clinical Neuroscience Transformer-Based Language Models
di: Mamalakis, Michail, et al.
Pubblicazione: (2026)
di: Mamalakis, Michail, et al.
Pubblicazione: (2026)
Multi-Attribute Steering of Language Models via Targeted Intervention
di: Nguyen, Duy, et al.
Pubblicazione: (2025)
di: Nguyen, Duy, et al.
Pubblicazione: (2025)
Exploring the Potential of Large Language Models as Predictors in Dynamic Text-Attributed Graphs
di: Lei, Runlin, et al.
Pubblicazione: (2025)
di: Lei, Runlin, et al.
Pubblicazione: (2025)
Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Topology of Reasoning: Understanding Large Reasoning Models through Reasoning Graph Properties
di: Minegishi, Gouki, et al.
Pubblicazione: (2025) -
Towards Empirical Interpretation of Internal Circuits and Properties in Grokked Transformers on Modular Polynomials
di: Furuta, Hiroki, et al.
Pubblicazione: (2024) -
RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
di: Matsutani, Kohsei, et al.
Pubblicazione: (2025) -
Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words
di: Minegishi, Gouki, et al.
Pubblicazione: (2025) -
Development and bilingual evaluation of Japanese medical large language model within reasonably low computational resources
di: Sukeda, Issey
Pubblicazione: (2024)