TracrBench: Generating Interpretability Testbeds with Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Thurnherr, Hannes, Scheurer, Jérémy |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Neural Decompiling of Tracr Transformers
von: Thurnherr, Hannes, et al.
Veröffentlicht: (2024)
von: Thurnherr, Hannes, et al.
Veröffentlicht: (2024)
Large Language Models can Strategically Deceive their Users when Put Under Pressure
von: Scheurer, Jérémy, et al.
Veröffentlicht: (2023)
von: Scheurer, Jérémy, et al.
Veröffentlicht: (2023)
Training Language Models with Language Feedback at Scale
von: Scheurer, Jérémy, et al.
Veröffentlicht: (2023)
von: Scheurer, Jérémy, et al.
Veröffentlicht: (2023)
AfroBench: How Good are Large Language Models on African Languages?
von: Ojo, Jessica, et al.
Veröffentlicht: (2023)
von: Ojo, Jessica, et al.
Veröffentlicht: (2023)
StyleBench: Evaluating thinking styles in Large Language Models
von: Guo, Junyu, et al.
Veröffentlicht: (2025)
von: Guo, Junyu, et al.
Veröffentlicht: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
Generalization of RLVR Using Causal Reasoning as a Testbed
von: Lu, Brian, et al.
Veröffentlicht: (2025)
von: Lu, Brian, et al.
Veröffentlicht: (2025)
$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model
von: Zhang, Yufeng, et al.
Veröffentlicht: (2024)
von: Zhang, Yufeng, et al.
Veröffentlicht: (2024)
Rethinking Interpretability in the Era of Large Language Models
von: Singh, Chandan, et al.
Veröffentlicht: (2024)
von: Singh, Chandan, et al.
Veröffentlicht: (2024)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
von: Feng, Jie, et al.
Veröffentlicht: (2024)
von: Feng, Jie, et al.
Veröffentlicht: (2024)
DiscoveryBench: Towards Data-Driven Discovery with Large Language Models
von: Majumder, Bodhisattwa Prasad, et al.
Veröffentlicht: (2024)
von: Majumder, Bodhisattwa Prasad, et al.
Veröffentlicht: (2024)
PromptBench: A Unified Library for Evaluation of Large Language Models
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
von: Cho, Hakaze, et al.
Veröffentlicht: (2025)
von: Cho, Hakaze, et al.
Veröffentlicht: (2025)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
von: Lee, Jaeho, et al.
Veröffentlicht: (2025)
von: Lee, Jaeho, et al.
Veröffentlicht: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
von: Muhamed, Aashiq, et al.
Veröffentlicht: (2025)
von: Muhamed, Aashiq, et al.
Veröffentlicht: (2025)
SelfIE: Self-Interpretation of Large Language Model Embeddings
von: Chen, Haozhe, et al.
Veröffentlicht: (2024)
von: Chen, Haozhe, et al.
Veröffentlicht: (2024)
Fine-Grained Interpretation of Political Opinions in Large Language Models
von: Hu, Jingyu, et al.
Veröffentlicht: (2025)
von: Hu, Jingyu, et al.
Veröffentlicht: (2025)
Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2026)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2026)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
von: Soo, Samuel, et al.
Veröffentlicht: (2025)
von: Soo, Samuel, et al.
Veröffentlicht: (2025)
Generating Multiple-Choice Knowledge Questions with Interpretable Difficulty Estimation using Knowledge Graphs and Large Language Models
von: Şakiroğlu, Mehmet Can, et al.
Veröffentlicht: (2026)
von: Şakiroğlu, Mehmet Can, et al.
Veröffentlicht: (2026)
Improving Code Generation by Training with Natural Language Feedback
von: Chen, Angelica, et al.
Veröffentlicht: (2023)
von: Chen, Angelica, et al.
Veröffentlicht: (2023)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2024)
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2024)
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2024)
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2024)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
von: Wang, Xiaoxuan, et al.
Veröffentlicht: (2023)
von: Wang, Xiaoxuan, et al.
Veröffentlicht: (2023)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
von: Tsui, Ken
Veröffentlicht: (2025)
von: Tsui, Ken
Veröffentlicht: (2025)
TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation
von: Ezzakri, Anas, et al.
Veröffentlicht: (2025)
von: Ezzakri, Anas, et al.
Veröffentlicht: (2025)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
von: Shu, Dong, et al.
Veröffentlicht: (2025)
von: Shu, Dong, et al.
Veröffentlicht: (2025)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
von: Lan, Michael, et al.
Veröffentlicht: (2023)
von: Lan, Michael, et al.
Veröffentlicht: (2023)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
von: Hu, Tiancheng, et al.
Veröffentlicht: (2025)
von: Hu, Tiancheng, et al.
Veröffentlicht: (2025)
Towards Interpretable Hate Speech Detection using Large Language Model-extracted Rationales
von: Nirmal, Ayushi, et al.
Veröffentlicht: (2024)
von: Nirmal, Ayushi, et al.
Veröffentlicht: (2024)
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
von: Wang, Qianli, et al.
Veröffentlicht: (2024)
von: Wang, Qianli, et al.
Veröffentlicht: (2024)
FCoReBench: Can Large Language Models Solve Challenging First-Order Combinatorial Reasoning Problems?
von: Mittal, Chinmay, et al.
Veröffentlicht: (2024)
von: Mittal, Chinmay, et al.
Veröffentlicht: (2024)
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models
von: Zbeeb, Mohammad, et al.
Veröffentlicht: (2025)
von: Zbeeb, Mohammad, et al.
Veröffentlicht: (2025)
Variational Language Concepts for Interpreting Foundation Language Models
von: Wang, Hengyi, et al.
Veröffentlicht: (2024)
von: Wang, Hengyi, et al.
Veröffentlicht: (2024)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
von: Xu, Xin, et al.
Veröffentlicht: (2025)
von: Xu, Xin, et al.
Veröffentlicht: (2025)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation
von: Casademunt, Helena, et al.
Veröffentlicht: (2026)
von: Casademunt, Helena, et al.
Veröffentlicht: (2026)
Counterfactual Token Generation in Large Language Models
von: Chatzi, Ivi, et al.
Veröffentlicht: (2024)
von: Chatzi, Ivi, et al.
Veröffentlicht: (2024)
Markovian Generation Chains in Large Language Models
von: Geng, Mingmeng, et al.
Veröffentlicht: (2026)
von: Geng, Mingmeng, et al.
Veröffentlicht: (2026)
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
von: Feng, Xiaohua, et al.
Veröffentlicht: (2025)
von: Feng, Xiaohua, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Neural Decompiling of Tracr Transformers
von: Thurnherr, Hannes, et al.
Veröffentlicht: (2024) -
Large Language Models can Strategically Deceive their Users when Put Under Pressure
von: Scheurer, Jérémy, et al.
Veröffentlicht: (2023) -
Training Language Models with Language Feedback at Scale
von: Scheurer, Jérémy, et al.
Veröffentlicht: (2023) -
AfroBench: How Good are Large Language Models on African Languages?
von: Ojo, Jessica, et al.
Veröffentlicht: (2023) -
StyleBench: Evaluating thinking styles in Large Language Models
von: Guo, Junyu, et al.
Veröffentlicht: (2025)