Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Jinnai, Yuu, Morimura, Tetsuro, Ariu, Kaito, Abe, Kenshi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Model-Based Minimum Bayes Risk Decoding for Text Generation
por: Jinnai, Yuu, et al.
Publicado: (2023)
por: Jinnai, Yuu, et al.
Publicado: (2023)
Hyperparameter-Free Approach for Faster Minimum Bayes Risk Decoding
por: Jinnai, Yuu, et al.
Publicado: (2024)
por: Jinnai, Yuu, et al.
Publicado: (2024)
Filtered Direct Preference Optimization
por: Morimura, Tetsuro, et al.
Publicado: (2024)
por: Morimura, Tetsuro, et al.
Publicado: (2024)
Evaluation of Best-of-N Sampling Strategies for Language Model Alignment
por: Ichihara, Yuki, et al.
Publicado: (2025)
por: Ichihara, Yuki, et al.
Publicado: (2025)
Theoretical Guarantees for Minimum Bayes Risk Decoding
por: Ichihara, Yuki, et al.
Publicado: (2025)
por: Ichihara, Yuki, et al.
Publicado: (2025)
On the True Distribution Approximation of Minimum Bayes-Risk Decoding
por: Ohashi, Atsumoto, et al.
Publicado: (2024)
por: Ohashi, Atsumoto, et al.
Publicado: (2024)
Generating Diverse and High-Quality Texts by Minimum Bayes Risk Decoding
por: Jinnai, Yuu, et al.
Publicado: (2024)
por: Jinnai, Yuu, et al.
Publicado: (2024)
Document-Level Text Generation with Minimum Bayes Risk Decoding using Optimal Transport
por: Jinnai, Yuu
Publicado: (2025)
por: Jinnai, Yuu
Publicado: (2025)
Does Cross-Cultural Alignment Change the Commonsense Morality of Language Models?
por: Jinnai, Yuu
Publicado: (2024)
por: Jinnai, Yuu
Publicado: (2024)
Annotation-Efficient Language Model Alignment via Diverse and Representative Response Texts
por: Jinnai, Yuu, et al.
Publicado: (2024)
por: Jinnai, Yuu, et al.
Publicado: (2024)
Re-evaluating Minimum Bayes Risk Decoding for Automatic Speech Recognition
por: Jinnai, Yuu
Publicado: (2025)
por: Jinnai, Yuu
Publicado: (2025)
Last Iterate Convergence in Monotone Mean Field Games
por: Isobe, Noboru, et al.
Publicado: (2024)
por: Isobe, Noboru, et al.
Publicado: (2024)
Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes
por: Morimura, Tetsuro, et al.
Publicado: (2022)
por: Morimura, Tetsuro, et al.
Publicado: (2022)
Do Large Language Models Know Folktales? A Case Study of Yokai in Japanese Folktales
por: Tsutsumi, Ayuto, et al.
Publicado: (2025)
por: Tsutsumi, Ayuto, et al.
Publicado: (2025)
Return-Aligned Decision Transformer
por: Tanaka, Tsunehiko, et al.
Publicado: (2024)
por: Tanaka, Tsunehiko, et al.
Publicado: (2024)
Better Instruction-Following Through Minimum Bayes Risk
por: Wu, Ian, et al.
Publicado: (2024)
por: Wu, Ian, et al.
Publicado: (2024)
Mitigating Metric Bias in Minimum Bayes Risk Decoding
por: Kovacs, Geza, et al.
Publicado: (2024)
por: Kovacs, Geza, et al.
Publicado: (2024)
Nash Equilibrium and Learning Dynamics in Three-Player Matching $m$-Action Games
por: Fujimoto, Yuma, et al.
Publicado: (2024)
por: Fujimoto, Yuma, et al.
Publicado: (2024)
Synchronization in Learning in Periodic Zero-Sum Games Triggers Divergence from Nash Equilibrium
por: Fujimoto, Yuma, et al.
Publicado: (2024)
por: Fujimoto, Yuma, et al.
Publicado: (2024)
Time-Varyingness in Auction Breaks Revenue Equivalence
por: Fujimoto, Yuma, et al.
Publicado: (2024)
por: Fujimoto, Yuma, et al.
Publicado: (2024)
Global Behavior of Learning Dynamics in Zero-Sum Games with Memory Asymmetry
por: Fujimoto, Yuma, et al.
Publicado: (2024)
por: Fujimoto, Yuma, et al.
Publicado: (2024)
Learning from Delayed Feedback in Games via Extra Prediction
por: Fujimoto, Yuma, et al.
Publicado: (2025)
por: Fujimoto, Yuma, et al.
Publicado: (2025)
Linear Convergence in Games with Delayed Feedback via Extra Prediction
por: Fujimoto, Yuma, et al.
Publicado: (2026)
por: Fujimoto, Yuma, et al.
Publicado: (2026)
Memory Asymmetry Creates Heteroclinic Orbits to Nash Equilibrium in Learning in Zero-Sum Games
por: Fujimoto, Yuma, et al.
Publicado: (2023)
por: Fujimoto, Yuma, et al.
Publicado: (2023)
Variational Best-of-N Alignment
por: Amini, Afra, et al.
Publicado: (2024)
por: Amini, Afra, et al.
Publicado: (2024)
Uncertainty-Aware Decoding with Minimum Bayes Risk
por: Daheim, Nico, et al.
Publicado: (2025)
por: Daheim, Nico, et al.
Publicado: (2025)
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
por: Chow, Yinlam, et al.
Publicado: (2024)
por: Chow, Yinlam, et al.
Publicado: (2024)
TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
por: Qiu, Jiahao, et al.
Publicado: (2024)
por: Qiu, Jiahao, et al.
Publicado: (2024)
Agreement-Constrained Probabilistic Minimum Bayes Risk Decoding
por: Natsumi, Koki, et al.
Publicado: (2025)
por: Natsumi, Koki, et al.
Publicado: (2025)
Consensus Group Relative Policy Optimization for Text Generation
por: Ichihara, Yuki, et al.
Publicado: (2026)
por: Ichihara, Yuki, et al.
Publicado: (2026)
AdaBoN: Adaptive Best-of-N Alignment
por: Raman, Vinod, et al.
Publicado: (2025)
por: Raman, Vinod, et al.
Publicado: (2025)
MetaAligner: Towards Generalizable Multi-Objective Alignment of Language Models
por: Yang, Kailai, et al.
Publicado: (2024)
por: Yang, Kailai, et al.
Publicado: (2024)
Pareto Multi-Objective Alignment for Language Models
por: He, Qiang, et al.
Publicado: (2025)
por: He, Qiang, et al.
Publicado: (2025)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
por: Liu, Biao, et al.
Publicado: (2025)
por: Liu, Biao, et al.
Publicado: (2025)
Unveiling the Power of Source: Source-based Minimum Bayes Risk Decoding for Neural Machine Translation
por: Lyu, Boxuan, et al.
Publicado: (2024)
por: Lyu, Boxuan, et al.
Publicado: (2024)
Optimal Transport Regularization for Speech Text Alignment in Spoken Language Models
por: Xu, Wenze, et al.
Publicado: (2025)
por: Xu, Wenze, et al.
Publicado: (2025)
Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding
por: Wang, Yiming, et al.
Publicado: (2025)
por: Wang, Yiming, et al.
Publicado: (2025)
BayLing 2: A Multilingual Large Language Model with Efficient Language Alignment
por: Zhang, Shaolei, et al.
Publicado: (2024)
por: Zhang, Shaolei, et al.
Publicado: (2024)
Boosting Perturbed Gradient Ascent for Last-Iterate Convergence in Games
por: Abe, Kenshi, et al.
Publicado: (2024)
por: Abe, Kenshi, et al.
Publicado: (2024)
Adaptively Perturbed Mirror Descent for Learning in Games
por: Abe, Kenshi, et al.
Publicado: (2023)
por: Abe, Kenshi, et al.
Publicado: (2023)
Ejemplares similares
-
Model-Based Minimum Bayes Risk Decoding for Text Generation
por: Jinnai, Yuu, et al.
Publicado: (2023) -
Hyperparameter-Free Approach for Faster Minimum Bayes Risk Decoding
por: Jinnai, Yuu, et al.
Publicado: (2024) -
Filtered Direct Preference Optimization
por: Morimura, Tetsuro, et al.
Publicado: (2024) -
Evaluation of Best-of-N Sampling Strategies for Language Model Alignment
por: Ichihara, Yuki, et al.
Publicado: (2025) -
Theoretical Guarantees for Minimum Bayes Risk Decoding
por: Ichihara, Yuki, et al.
Publicado: (2025)