LogProber: Disentangling confidence from contamination in LLM responses
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yax, Nicolas, Oudeyer, Pierre-Yves, Palminteri, Stefano |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PhyloLM : Inferring the Phylogeny of Large Language Models and Predicting their Performances in Benchmarks
par: Yax, Nicolas, et autres
Publié: (2024)
par: Yax, Nicolas, et autres
Publié: (2024)
Relative Value Biases in Large Language Models
par: Hayes, William M., et autres
Publié: (2024)
par: Hayes, William M., et autres
Publié: (2024)
Large Language Models are Biased Reinforcement Learners
par: Hayes, William M., et autres
Publié: (2024)
par: Hayes, William M., et autres
Publié: (2024)
Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI
par: Pourcel, Julien, et autres
Publié: (2025)
par: Pourcel, Julien, et autres
Publié: (2025)
Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning
par: Zou, Jiaru, et autres
Publié: (2025)
par: Zou, Jiaru, et autres
Publié: (2025)
Stick to your Role! Stability of Personal Values Expressed in Large Language Models
par: Kovač, Grgur, et autres
Publié: (2024)
par: Kovač, Grgur, et autres
Publié: (2024)
Recursive Training Loops in LLMs: How training data properties modulate distribution shift in generated data?
par: Kovač, Grgur, et autres
Publié: (2025)
par: Kovač, Grgur, et autres
Publié: (2025)
Automatic Generation of Question Hints for Mathematics Problems using Large Language Models in Educational Technology
par: Tonga, Junior Cedric, et autres
Publié: (2024)
par: Tonga, Junior Cedric, et autres
Publié: (2024)
WorldLLM: Improving LLMs' world modeling using curiosity-driven theory-making
par: Levy, Guillaume, et autres
Publié: (2025)
par: Levy, Guillaume, et autres
Publié: (2025)
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation
par: Chen, Han, et autres
Publié: (2025)
par: Chen, Han, et autres
Publié: (2025)
Autotelic Agents with Intrinsically Motivated Goal-Conditioned Reinforcement Learning: a Short Survey
par: Colas, Cédric, et autres
Publié: (2020)
par: Colas, Cédric, et autres
Publié: (2020)
SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight Relabeling
par: Gaven, Loris, et autres
Publié: (2024)
par: Gaven, Loris, et autres
Publié: (2024)
Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought
par: Boppana, Siddharth, et autres
Publié: (2026)
par: Boppana, Siddharth, et autres
Publié: (2026)
Log-Likelihood, Simpson's Paradox, and the Detection of Machine-Generated Text
par: Kempton, Tom, et autres
Publié: (2026)
par: Kempton, Tom, et autres
Publié: (2026)
From Chat Logs to Collective Insights: Aggregative Question Answering
par: Zhang, Wentao, et autres
Publié: (2025)
par: Zhang, Wentao, et autres
Publié: (2025)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
Log-Augmented Generation: Scaling Test-Time Reasoning with Reusable Computation
par: Chen, Peter Baile, et autres
Publié: (2025)
par: Chen, Peter Baile, et autres
Publié: (2025)
Anonymous-by-Construction: An LLM-Driven Framework for Privacy-Preserving Text
par: Albanese, Federico, et autres
Publié: (2026)
par: Albanese, Federico, et autres
Publié: (2026)
Latent Concept Disentanglement in Transformer-based Language Models
par: Hong, Guan Zhe, et autres
Publié: (2025)
par: Hong, Guan Zhe, et autres
Publié: (2025)
Quantifying Modality Contributions via Disentangling Multimodal Representations
par: Amit, Padegal, et autres
Publié: (2025)
par: Amit, Padegal, et autres
Publié: (2025)
Disentangling Exploration of Large Language Models by Optimal Exploitation
par: Grams, Tim, et autres
Publié: (2025)
par: Grams, Tim, et autres
Publié: (2025)
Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination
par: Agnimo, Yedidia, et autres
Publié: (2026)
par: Agnimo, Yedidia, et autres
Publié: (2026)
Subliminal Effects in Your Data: A General Mechanism via Log-Linearity
par: Aden-Ali, Ishaq, et autres
Publié: (2026)
par: Aden-Ali, Ishaq, et autres
Publié: (2026)
Interpretable Discriminative Text Representations via Agreement and Label Disentanglement
par: Wang, Tong, et autres
Publié: (2026)
par: Wang, Tong, et autres
Publié: (2026)
Disentangling the Roles of Target-Side Transfer and Regularization in Multilingual Machine Translation
par: Meng, Yan, et autres
Publié: (2024)
par: Meng, Yan, et autres
Publié: (2024)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
par: Hua, Wenyue, et autres
Publié: (2024)
par: Hua, Wenyue, et autres
Publié: (2024)
EuroLLM-9B: Technical Report
par: Martins, Pedro Henrique, et autres
Publié: (2025)
par: Martins, Pedro Henrique, et autres
Publié: (2025)
ACES: Generating Diverse Programming Puzzles with with Autotelic Generative Models
par: Pourcel, Julien, et autres
Publié: (2023)
par: Pourcel, Julien, et autres
Publié: (2023)
EuroLLM-22B: Technical Report
par: Ramos, Miguel Moura, et autres
Publié: (2026)
par: Ramos, Miguel Moura, et autres
Publié: (2026)
Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment
par: Krishna, Kundan, et autres
Publié: (2025)
par: Krishna, Kundan, et autres
Publié: (2025)
Multi-Step Knowledge Interaction Analysis via Rank-2 Subspace Disentanglement
par: Islam, Sekh Mainul, et autres
Publié: (2025)
par: Islam, Sekh Mainul, et autres
Publié: (2025)
Disentangling Task Conflicts in Multi-Task LoRA via Orthogonal Gradient Projection
par: Yang, Ziyu, et autres
Publié: (2026)
par: Yang, Ziyu, et autres
Publié: (2026)
Disentangling Feature Structure: A Mathematically Provable Two-Stage Training Dynamics in Transformers
par: Gong, Zixuan, et autres
Publié: (2025)
par: Gong, Zixuan, et autres
Publié: (2025)
From Isolation to Entanglement: When Do Interpretability Methods Identify and Disentangle Known Concepts?
par: Mueller, Aaron, et autres
Publié: (2025)
par: Mueller, Aaron, et autres
Publié: (2025)
Detecting Relevant Information in High-Volume Chat Logs: Keyphrase Extraction for Grooming and Drug Dealing Forensic Analysis
par: Alves, Jeovane Honório, et autres
Publié: (2023)
par: Alves, Jeovane Honório, et autres
Publié: (2023)
Towards Multilingual LLM Evaluation for European Languages
par: Thellmann, Klaudia, et autres
Publié: (2024)
par: Thellmann, Klaudia, et autres
Publié: (2024)
DLF: Disentangled-Language-Focused Multimodal Sentiment Analysis
par: Wang, Pan, et autres
Publié: (2024)
par: Wang, Pan, et autres
Publié: (2024)
Improved Performances and Motivation in Intelligent Tutoring Systems: Combining Machine Learning and Learner Choice
par: Clément, Benjamin, et autres
Publié: (2024)
par: Clément, Benjamin, et autres
Publié: (2024)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
par: Karlekar, Sweta, et autres
Publié: (2026)
par: Karlekar, Sweta, et autres
Publié: (2026)
The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems
par: Ren, Richard, et autres
Publié: (2025)
par: Ren, Richard, et autres
Publié: (2025)
Documents similaires
-
PhyloLM : Inferring the Phylogeny of Large Language Models and Predicting their Performances in Benchmarks
par: Yax, Nicolas, et autres
Publié: (2024) -
Relative Value Biases in Large Language Models
par: Hayes, William M., et autres
Publié: (2024) -
Large Language Models are Biased Reinforcement Learners
par: Hayes, William M., et autres
Publié: (2024) -
Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI
par: Pourcel, Julien, et autres
Publié: (2025) -
Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning
par: Zou, Jiaru, et autres
Publié: (2025)