DiFR: Inference Verification Despite Nondeterminism
Fuente:
arXiv
Salvato in:
| Autori principali: | Karvonen, Adam, Reuter, Daniel, Rinberg, Roy, Marks, Luke, Garriga-Alonso, Adrià, Warr, Keri |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Verifying LLM Inference to Detect Model Weight Exfiltration
di: Rinberg, Roy, et al.
Pubblicazione: (2025)
di: Rinberg, Roy, et al.
Pubblicazione: (2025)
Haiku to Opus in Just 10 bits: LLMs Unlock Massive Compression Gains
di: Rinberg, Roy, et al.
Pubblicazione: (2026)
di: Rinberg, Roy, et al.
Pubblicazione: (2026)
Among Us: A Sandbox for Measuring and Detecting Agentic Deception
di: Golechha, Satvik, et al.
Pubblicazione: (2025)
di: Golechha, Satvik, et al.
Pubblicazione: (2025)
SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data
di: Chanin, David, et al.
Pubblicazione: (2026)
di: Chanin, David, et al.
Pubblicazione: (2026)
Robustly Improving LLM Fairness in Realistic Settings via Interpretability
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025)
di: Chanin, David, et al.
Pubblicazione: (2025)
Path Channels and Plan Extension Kernels: a Mechanistic Description of Planning in a Sokoban RNN
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2025)
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2025)
Feature Hedging: Correlated Features Break Narrow Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025)
di: Chanin, David, et al.
Pubblicazione: (2025)
Biases in the Blind Spot: Detecting What LLMs Fail to Mention
di: Arcuschin, Iván, et al.
Pubblicazione: (2026)
di: Arcuschin, Iván, et al.
Pubblicazione: (2026)
Interpreting Emergent Planning in Model-Free Reinforcement Learning
di: Bush, Thomas, et al.
Pubblicazione: (2025)
di: Bush, Thomas, et al.
Pubblicazione: (2025)
Have it your way: Individualized Privacy Assignment for DP-SGD
di: Boenisch, Franziska, et al.
Pubblicazione: (2023)
di: Boenisch, Franziska, et al.
Pubblicazione: (2023)
Planning in a recurrent neural network that plays Sokoban
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2024)
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2024)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
Optimistic Verifiable Training by Controlling Hardware Nondeterminism
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
di: Srivastava, Megha, et al.
Pubblicazione: (2024)
Learning Multi-Level Features with Matryoshka Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2025)
di: Bussmann, Bart, et al.
Pubblicazione: (2025)
Hypothesis Testing the Circuit Hypothesis in LLMs
di: Shi, Claudia, et al.
Pubblicazione: (2024)
di: Shi, Claudia, et al.
Pubblicazione: (2024)
Automatically Finding Rule-Based Neurons in OthelloGPT
di: Singh, Aditya, et al.
Pubblicazione: (2025)
di: Singh, Aditya, et al.
Pubblicazione: (2025)
Data Science In Olfaction
di: Agarwal, Vivek, et al.
Pubblicazione: (2024)
di: Agarwal, Vivek, et al.
Pubblicazione: (2024)
Measuring Progress in Dictionary Learning for Language Model Interpretability with Board Game Models
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
ConDiSim: Conditional Diffusion Models for Simulation Based Inference
di: Nautiyal, Mayank, et al.
Pubblicazione: (2025)
di: Nautiyal, Mayank, et al.
Pubblicazione: (2025)
Investigating the Indirect Object Identification circuit in Mamba
di: Ensign, Danielle, et al.
Pubblicazione: (2024)
di: Ensign, Danielle, et al.
Pubblicazione: (2024)
Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
Sample, Scrutinize and Scale: Effective Inference-Time Search by Scaling Verification
di: Zhao, Eric, et al.
Pubblicazione: (2025)
di: Zhao, Eric, et al.
Pubblicazione: (2025)
Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification
di: Liang, Zhenwen, et al.
Pubblicazione: (2024)
di: Liang, Zhenwen, et al.
Pubblicazione: (2024)
Semi-Supervised Learning for Deep Causal Generative Models
di: Ibrahim, Yasin, et al.
Pubblicazione: (2024)
di: Ibrahim, Yasin, et al.
Pubblicazione: (2024)
Decoding Answers Before Chain-of-Thought: Evidence from Pre-CoT Probes and Activation Steering
di: Cox, Kyle, et al.
Pubblicazione: (2026)
di: Cox, Kyle, et al.
Pubblicazione: (2026)
When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
di: Wang, Zehao, et al.
Pubblicazione: (2026)
di: Wang, Zehao, et al.
Pubblicazione: (2026)
Negation Neglect: When models fail to learn negations in training
di: Mayne, Harry, et al.
Pubblicazione: (2026)
di: Mayne, Harry, et al.
Pubblicazione: (2026)
Specialised or Generic? Tokenization Choices for Radiology Language Models
di: Warr, Hermione, et al.
Pubblicazione: (2025)
di: Warr, Hermione, et al.
Pubblicazione: (2025)
TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability Research
di: Harrasse, Abir, et al.
Pubblicazione: (2025)
di: Harrasse, Abir, et al.
Pubblicazione: (2025)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
Compute Aligned Training: Optimizing for Test Time Inference
di: Ousherovitch, Adam, et al.
Pubblicazione: (2026)
di: Ousherovitch, Adam, et al.
Pubblicazione: (2026)
Revisiting the (Sub)Optimality of Best-of-N for Inference-Time Alignment
di: Sriraman, Ved, et al.
Pubblicazione: (2026)
di: Sriraman, Ved, et al.
Pubblicazione: (2026)
Output Supervision Can Obfuscate the Chain of Thought
di: Drori, Jacob, et al.
Pubblicazione: (2025)
di: Drori, Jacob, et al.
Pubblicazione: (2025)
ReDi: Rectified Discrete Flow
di: Yoo, Jaehoon, et al.
Pubblicazione: (2025)
di: Yoo, Jaehoon, et al.
Pubblicazione: (2025)
DiEC: Diffusion Embedded Clustering
di: Hu, Haidong, et al.
Pubblicazione: (2025)
di: Hu, Haidong, et al.
Pubblicazione: (2025)
Catastrophic Goodhart: regularizing RLHF with KL divergence does not mitigate heavy-tailed reward misspecification
di: Kwa, Thomas, et al.
Pubblicazione: (2024)
di: Kwa, Thomas, et al.
Pubblicazione: (2024)
Adversarial Circuit Evaluation
di: de Bos, Niels uit, et al.
Pubblicazione: (2024)
di: de Bos, Niels uit, et al.
Pubblicazione: (2024)
Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs
di: Rottoli, Michael, et al.
Pubblicazione: (2026)
di: Rottoli, Michael, et al.
Pubblicazione: (2026)
Linear Mode Connectivity in Sparse Neural Networks
di: McDermott, Luke, et al.
Pubblicazione: (2023)
di: McDermott, Luke, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Verifying LLM Inference to Detect Model Weight Exfiltration
di: Rinberg, Roy, et al.
Pubblicazione: (2025) -
Haiku to Opus in Just 10 bits: LLMs Unlock Massive Compression Gains
di: Rinberg, Roy, et al.
Pubblicazione: (2026) -
Among Us: A Sandbox for Measuring and Detecting Agentic Deception
di: Golechha, Satvik, et al.
Pubblicazione: (2025) -
SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data
di: Chanin, David, et al.
Pubblicazione: (2026) -
Robustly Improving LLM Fairness in Realistic Settings via Interpretability
di: Karvonen, Adam, et al.
Pubblicazione: (2025)