Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Feng, Mingqian, Liu, Xiaodong, Yang, Weiwei, Xu, Chenliang, White, Christopher, Gao, Jianfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks
par: Yu, Xiaodong, et autres
Publié: (2023)
par: Yu, Xiaodong, et autres
Publié: (2023)
Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?
par: Feng, Mingqian, et autres
Publié: (2024)
par: Feng, Mingqian, et autres
Publié: (2024)
Discover and Mitigate Multiple Biased Subgroups in Image Classifiers
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment
par: Jinnai, Yuu, et autres
Publié: (2024)
par: Jinnai, Yuu, et autres
Publié: (2024)
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
par: Chow, Yinlam, et autres
Publié: (2024)
par: Chow, Yinlam, et autres
Publié: (2024)
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
par: Feng, Mingqian, et autres
Publié: (2026)
par: Feng, Mingqian, et autres
Publié: (2026)
Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding
par: Wang, Yiming, et autres
Publié: (2025)
par: Wang, Yiming, et autres
Publié: (2025)
Forward Learning for Gradient-based Black-box Saliency Map Generation
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
Estimating the Effects of Sample Training Orders for Large Language Models without Retraining
par: Yang, Hao, et autres
Publié: (2025)
par: Yang, Hao, et autres
Publié: (2025)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
Best of mini-N in-loop Sampling: A Contextual Quality Reward Model for Reliable and Efficient Best-of-N Sampling
par: Rho, Hyung Gyu, et autres
Publié: (2025)
par: Rho, Hyung Gyu, et autres
Publié: (2025)
Language Models as Inductive Reasoners
par: Yang, Zonglin, et autres
Publié: (2022)
par: Yang, Zonglin, et autres
Publié: (2022)
Best Practices for Large Language Models in Radiology
par: Bluethgen, Christian, et autres
Publié: (2024)
par: Bluethgen, Christian, et autres
Publié: (2024)
SAFER: Risk-Constrained Sample-then-Filter in Large Language Models
par: Wang, Qingni, et autres
Publié: (2025)
par: Wang, Qingni, et autres
Publié: (2025)
Adversarial Attacks on Large Language Models in Medicine
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Personalized Risks and Regulatory Strategies of Large Language Models in Digital Advertising
par: Feng, Haoyang, et autres
Publié: (2025)
par: Feng, Haoyang, et autres
Publié: (2025)
Scalable Delphi: Large Language Models for Structured Risk Estimation
par: Lorenz, Tobias, et autres
Publié: (2026)
par: Lorenz, Tobias, et autres
Publié: (2026)
Learning to Transform Dynamically for Better Adversarial Transferability
par: Zhu, Rongyi, et autres
Publié: (2024)
par: Zhu, Rongyi, et autres
Publié: (2024)
BayLing 2: A Multilingual Large Language Model with Efficient Language Alignment
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
par: Kang, Zhewei, et autres
Publié: (2025)
par: Kang, Zhewei, et autres
Publié: (2025)
Large Language Models: A Survey
par: Minaee, Shervin, et autres
Publié: (2024)
par: Minaee, Shervin, et autres
Publié: (2024)
Automated Retrosynthesis Planning of Macromolecules Using Large Language Models and Knowledge Graphs
par: Ma, Qinyu, et autres
Publié: (2025)
par: Ma, Qinyu, et autres
Publié: (2025)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
par: Diao, Muxi, et autres
Publié: (2024)
par: Diao, Muxi, et autres
Publié: (2024)
FLOPS: Forward Learning with OPtimal Sampling
par: Ren, Tao, et autres
Publié: (2024)
par: Ren, Tao, et autres
Publié: (2024)
StreamAdapter: Efficient Test Time Adaptation from Contextual Streams
par: Muhtar, Dilxat, et autres
Publié: (2024)
par: Muhtar, Dilxat, et autres
Publié: (2024)
Tracking the Copyright of Large Vision-Language Models through Parameter Learning Adversarial Images
par: Wang, Yubo, et autres
Publié: (2025)
par: Wang, Yubo, et autres
Publié: (2025)
CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning
par: Tang, Yung-Chen, et autres
Publié: (2025)
par: Tang, Yung-Chen, et autres
Publié: (2025)
Adversarial Moral Stress Testing of Large Language Models
par: Jamshidi, Saeid, et autres
Publié: (2026)
par: Jamshidi, Saeid, et autres
Publié: (2026)
Rethinking Interpretability in the Era of Large Language Models
par: Singh, Chandan, et autres
Publié: (2024)
par: Singh, Chandan, et autres
Publié: (2024)
Soft Best-of-n Sampling for Model Alignment
par: Verdun, Claudio Mayrink, et autres
Publié: (2025)
par: Verdun, Claudio Mayrink, et autres
Publié: (2025)
On Adversarial Robustness and Out-of-Distribution Robustness of Large Language Models
par: Yang, April, et autres
Publié: (2024)
par: Yang, April, et autres
Publié: (2024)
PR-Attack: Coordinated Prompt-RAG Attacks on Retrieval-Augmented Generation in Large Language Models via Bilevel Optimization
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
Inference to the Best Explanation in Large Language Models
par: Dalal, Dhairya, et autres
Publié: (2024)
par: Dalal, Dhairya, et autres
Publié: (2024)
Model Tells Itself Where to Attend: Faithfulness Meets Automatic Attention Steering
par: Zhang, Qingru, et autres
Publié: (2024)
par: Zhang, Qingru, et autres
Publié: (2024)
S$^4$C: Speculative Sampling with Syntactic and Semantic Coherence for Efficient Inference of Large Language Models
par: He, Tao, et autres
Publié: (2025)
par: He, Tao, et autres
Publié: (2025)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
par: Zhang, Xinwei, et autres
Publié: (2026)
par: Zhang, Xinwei, et autres
Publié: (2026)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
par: Liu, Chaohu, et autres
Publié: (2025)
par: Liu, Chaohu, et autres
Publié: (2025)
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
par: Wang, Qingni, et autres
Publié: (2024)
par: Wang, Qingni, et autres
Publié: (2024)
CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization
par: Sun, Weiwei, et autres
Publié: (2025)
par: Sun, Weiwei, et autres
Publié: (2025)
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
par: Liu, Yan, et autres
Publié: (2026)
par: Liu, Yan, et autres
Publié: (2026)
Documents similaires
-
ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks
par: Yu, Xiaodong, et autres
Publié: (2023) -
Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?
par: Feng, Mingqian, et autres
Publié: (2024) -
Discover and Mitigate Multiple Biased Subgroups in Image Classifiers
par: Zhang, Zeliang, et autres
Publié: (2024) -
Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment
par: Jinnai, Yuu, et autres
Publié: (2024) -
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
par: Chow, Yinlam, et autres
Publié: (2024)