Reducing the Probability of Undesirable Outputs in Language Models Using Probabilistic Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Stephen, Li, Aidan, Brekelmans, Rob, Grosse, Roger |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Probabilistic Inference in Language Models via Twisted Sequential Monte Carlo
par: Zhao, Stephen, et autres
Publié: (2024)
par: Zhao, Stephen, et autres
Publié: (2024)
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
par: Li, Zhe, et autres
Publié: (2025)
par: Li, Zhe, et autres
Publié: (2025)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
par: Yuan, Zhuowen, et autres
Publié: (2024)
par: Yuan, Zhuowen, et autres
Publié: (2024)
Understanding Token Probability Encoding in Output Embeddings
par: Cho, Hakaze, et autres
Publié: (2024)
par: Cho, Hakaze, et autres
Publié: (2024)
Active Preference Inference using Language Models and Probabilistic Reasoning
par: Piriyakulkij, Wasu Top, et autres
Publié: (2023)
par: Piriyakulkij, Wasu Top, et autres
Publié: (2023)
SLOT: Structuring the Output of Large Language Models
par: Wang, Darren Yow-Bang, et autres
Publié: (2025)
par: Wang, Darren Yow-Bang, et autres
Publié: (2025)
An Evaluation on Large Language Model Outputs: Discourse and Memorization
par: de Wynter, Adrian, et autres
Publié: (2023)
par: de Wynter, Adrian, et autres
Publié: (2023)
Leviathan: Decoupling Input and Output Representations in Language Models
par: Batley, Reza T., et autres
Publié: (2026)
par: Batley, Reza T., et autres
Publié: (2026)
PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Models
par: Zhao, Chenzhuo, et autres
Publié: (2025)
par: Zhao, Chenzhuo, et autres
Publié: (2025)
Reducing the Scope of Language Models
par: Yunis, David, et autres
Publié: (2024)
par: Yunis, David, et autres
Publié: (2024)
OptScale: Probabilistic Optimality for Inference-time Scaling
par: Wang, Youkang, et autres
Publié: (2025)
par: Wang, Youkang, et autres
Publié: (2025)
Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
par: Anschel, Oron, et autres
Publié: (2025)
par: Anschel, Oron, et autres
Publié: (2025)
Graph-based Uncertainty Metrics for Long-form Language Model Outputs
par: Jiang, Mingjian, et autres
Publié: (2024)
par: Jiang, Mingjian, et autres
Publié: (2024)
Probabilistic Token Alignment for Large Language Model Fusion
par: Zeng, Runjia, et autres
Publié: (2025)
par: Zeng, Runjia, et autres
Publié: (2025)
Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification
par: Fadeeva, Ekaterina, et autres
Publié: (2024)
par: Fadeeva, Ekaterina, et autres
Publié: (2024)
Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models
par: Kumar, Abhishek, et autres
Publié: (2024)
par: Kumar, Abhishek, et autres
Publié: (2024)
Fourier Head: Helping Large Language Models Learn Complex Probability Distributions
par: Gillman, Nate, et autres
Publié: (2024)
par: Gillman, Nate, et autres
Publié: (2024)
When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models
par: Galeone, Cosimo, et autres
Publié: (2026)
par: Galeone, Cosimo, et autres
Publié: (2026)
Scaling Inference-Efficient Language Models
par: Bian, Song, et autres
Publié: (2025)
par: Bian, Song, et autres
Publié: (2025)
Pyramid MoA: A Probabilistic Framework for Cost-Optimized Anytime Inference
par: Khaled, Arindam
Publié: (2026)
par: Khaled, Arindam
Publié: (2026)
Fine-Grained Uncertainty Quantification for Long-Form Language Model Outputs: A Comparative Study
par: Bouchard, Dylan, et autres
Publié: (2026)
par: Bouchard, Dylan, et autres
Publié: (2026)
A Voter-Based Stochastic Rejection-Method Framework for Asymptotically Safe Language Model Outputs
par: Watts, Jake R., et autres
Publié: (2024)
par: Watts, Jake R., et autres
Publié: (2024)
Syntactic Control of Language Models by Posterior Inference
par: Xefteri, Vicky, et autres
Publié: (2025)
par: Xefteri, Vicky, et autres
Publié: (2025)
Causal Inference for Human-Language Model Collaboration
par: Zhang, Bohan, et autres
Publié: (2024)
par: Zhang, Bohan, et autres
Publié: (2024)
diff History for Neural Language Agents
par: Piterbarg, Ulyana, et autres
Publié: (2023)
par: Piterbarg, Ulyana, et autres
Publié: (2023)
Pruning as a Defense: Reducing Memorization in Large Language Models
par: Gupta, Mansi, et autres
Publié: (2025)
par: Gupta, Mansi, et autres
Publié: (2025)
Sustainable LLM Inference for Edge AI: Evaluating Quantized LLMs for Energy Efficiency, Output Accuracy, and Inference Latency
par: Husom, Erik Johannes, et autres
Publié: (2025)
par: Husom, Erik Johannes, et autres
Publié: (2025)
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
par: Guo, Shiyuan, et autres
Publié: (2025)
par: Guo, Shiyuan, et autres
Publié: (2025)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
par: Li, Kenneth, et autres
Publié: (2023)
par: Li, Kenneth, et autres
Publié: (2023)
Optimizing Temperature for Language Models with Multi-Sample Inference
par: Du, Weihua, et autres
Publié: (2025)
par: Du, Weihua, et autres
Publié: (2025)
Hypothesis Generation and Inductive Inference in Children and Language Models
par: Qin, Jeffrey, et autres
Publié: (2026)
par: Qin, Jeffrey, et autres
Publié: (2026)
Phase Transitions in the Output Distribution of Large Language Models
par: Arnold, Julian, et autres
Publié: (2024)
par: Arnold, Julian, et autres
Publié: (2024)
Language Rectified Flow: Advancing Diffusion Language Generation with Probabilistic Flows
par: Zhang, Shujian, et autres
Publié: (2024)
par: Zhang, Shujian, et autres
Publié: (2024)
Protein Language Models Diverge from Natural Language: Comparative Analysis and Improved Inference
par: Hart, Anna, et autres
Publié: (2026)
par: Hart, Anna, et autres
Publié: (2026)
Adversarial Attacks on AI-Generated Text Detection Models: A Token Probability-Based Approach Using Embeddings
par: Kadhim, Ahmed K., et autres
Publié: (2025)
par: Kadhim, Ahmed K., et autres
Publié: (2025)
AXOLOTL: Fairness through Assisted Self-Debiasing of Large Language Model Outputs
par: Ebrahimi, Sana, et autres
Publié: (2024)
par: Ebrahimi, Sana, et autres
Publié: (2024)
Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees
par: Chen, Sijia, et autres
Publié: (2024)
par: Chen, Sijia, et autres
Publié: (2024)
Block Transformer: Global-to-Local Language Modeling for Fast Inference
par: Ho, Namgyu, et autres
Publié: (2024)
par: Ho, Namgyu, et autres
Publié: (2024)
An Efficient Inference Framework for Early-exit Large Language Models
par: Miao, Ruijie, et autres
Publié: (2024)
par: Miao, Ruijie, et autres
Publié: (2024)
Revisiting In-context Learning Inference Circuit in Large Language Models
par: Cho, Hakaze, et autres
Publié: (2024)
par: Cho, Hakaze, et autres
Publié: (2024)
Documents similaires
-
Probabilistic Inference in Language Models via Twisted Sequential Monte Carlo
par: Zhao, Stephen, et autres
Publié: (2024) -
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
par: Li, Zhe, et autres
Publié: (2025) -
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
par: Yuan, Zhuowen, et autres
Publié: (2024) -
Understanding Token Probability Encoding in Output Embeddings
par: Cho, Hakaze, et autres
Publié: (2024) -
Active Preference Inference using Language Models and Probabilistic Reasoning
par: Piriyakulkij, Wasu Top, et autres
Publié: (2023)