M-RewardBench: Evaluating Reward Models in Multilingual Settings
Fuente:
arXiv
Guardado en:
| Autores principales: | Gureja, Srishti, Miranda, Lester James V., Islam, Shayekh Bin, Maheshwary, Rishabh, Sharma, Drishti, Winata, Gusti, Lambert, Nathan, Ruder, Sebastian, Hooker, Sara, Fadaee, Marzieh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Verification Limits Code LLM Training
por: Gureja, Srishti, et al.
Publicado: (2025)
por: Gureja, Srishti, et al.
Publicado: (2025)
RewardBench 2: Advancing Reward Model Evaluation
por: Malik, Saumya, et al.
Publicado: (2025)
por: Malik, Saumya, et al.
Publicado: (2025)
RewardBench: Evaluating Reward Models for Language Modeling
por: Lambert, Nathan, et al.
Publicado: (2024)
por: Lambert, Nathan, et al.
Publicado: (2024)
LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives
por: Shimabucoro, Luísa, et al.
Publicado: (2024)
por: Shimabucoro, Luísa, et al.
Publicado: (2024)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
por: Ma, Qiyao, et al.
Publicado: (2026)
por: Ma, Qiyao, et al.
Publicado: (2026)
A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics
por: Shimabucoro, Luisa, et al.
Publicado: (2025)
por: Shimabucoro, Luisa, et al.
Publicado: (2025)
Explainable AI-Generated Image Detection RewardBench
por: Yang, Michael, et al.
Publicado: (2025)
por: Yang, Michael, et al.
Publicado: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
por: Huang, Hui, et al.
Publicado: (2026)
por: Huang, Hui, et al.
Publicado: (2026)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
por: Ma, Yinghao, et al.
Publicado: (2026)
por: Ma, Yinghao, et al.
Publicado: (2026)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
por: Hu, Yushi, et al.
Publicado: (2025)
por: Hu, Yushi, et al.
Publicado: (2025)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
por: Jin, Zhuoran, et al.
Publicado: (2024)
por: Jin, Zhuoran, et al.
Publicado: (2024)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
por: Wen, Bosi, et al.
Publicado: (2026)
por: Wen, Bosi, et al.
Publicado: (2026)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
por: Ding, Meidan, et al.
Publicado: (2025)
por: Ding, Meidan, et al.
Publicado: (2025)
The Art of Asking: Multilingual Prompt Optimization for Synthetic Data
por: Mora, David, et al.
Publicado: (2025)
por: Mora, David, et al.
Publicado: (2025)
The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm
por: Aakanksha, et al.
Publicado: (2024)
por: Aakanksha, et al.
Publicado: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
por: Men, Tianyi, et al.
Publicado: (2025)
por: Men, Tianyi, et al.
Publicado: (2025)
Automatic WordNet Construction Using Markov Chain Monte Carlo
por: Marzieh Fadaee
Publicado: (2013)
por: Marzieh Fadaee
Publicado: (2013)
SimMerge: Learning to Select Merge Operators from Similarity Signals
por: Bolton, Oliver, et al.
Publicado: (2026)
por: Bolton, Oliver, et al.
Publicado: (2026)
MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models
por: Son, Guijin, et al.
Publicado: (2024)
por: Son, Guijin, et al.
Publicado: (2024)
Mix Data or Merge Models? Optimizing for Diverse Multi-Task Learning
por: Aakanksha, et al.
Publicado: (2024)
por: Aakanksha, et al.
Publicado: (2024)
R3: Robust Rubric-Agnostic Reward Models
por: Anugraha, David, et al.
Publicado: (2025)
por: Anugraha, David, et al.
Publicado: (2025)
How Does Quantization Affect Multilingual LLMs?
por: Marchisio, Kelly, et al.
Publicado: (2024)
por: Marchisio, Kelly, et al.
Publicado: (2024)
mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
por: Anugraha, David, et al.
Publicado: (2025)
por: Anugraha, David, et al.
Publicado: (2025)
One Tokenizer To Rule Them All: Emergent Language Plasticity via Multilingual Tokenizers
por: Abagyan, Diana, et al.
Publicado: (2025)
por: Abagyan, Diana, et al.
Publicado: (2025)
Maya: An Instruction Finetuned Multilingual Multimodal Model
por: Alam, Nahid, et al.
Publicado: (2024)
por: Alam, Nahid, et al.
Publicado: (2024)
Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation
por: Kreutzer, Julia, et al.
Publicado: (2025)
por: Kreutzer, Julia, et al.
Publicado: (2025)
NeoBabel: A Multilingual Open Tower for Visual Generation
por: Derakhshani, Mohammad Mahdi, et al.
Publicado: (2025)
por: Derakhshani, Mohammad Mahdi, et al.
Publicado: (2025)
Diversify and Conquer: Diversity-Centric Data Selection with Iterative Refinement
por: Yu, Simon, et al.
Publicado: (2024)
por: Yu, Simon, et al.
Publicado: (2024)
Behind Maya: Building a Multilingual Vision Language Model
por: Alam, Nahid, et al.
Publicado: (2025)
por: Alam, Nahid, et al.
Publicado: (2025)
M2Lingual: Enhancing Multilingual, Multi-Turn Instruction Alignment in Large Language Models
por: Maheshwary, Rishabh, et al.
Publicado: (2024)
por: Maheshwary, Rishabh, et al.
Publicado: (2024)
Bangla Grammatical Error Detection Leveraging Transformer-based Token Classification
por: Islam, Shayekh Bin, et al.
Publicado: (2024)
por: Islam, Shayekh Bin, et al.
Publicado: (2024)
Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs
por: Ahmadian, Arash, et al.
Publicado: (2024)
por: Ahmadian, Arash, et al.
Publicado: (2024)
The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating It
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
Aya 23: Open Weight Releases to Further Multilingual Progress
por: Aryabumi, Viraat, et al.
Publicado: (2024)
por: Aryabumi, Viraat, et al.
Publicado: (2024)
Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation
por: Salazar, Israfel, et al.
Publicado: (2025)
por: Salazar, Israfel, et al.
Publicado: (2025)
To Code, or Not To Code? Exploring Impact of Code in Pre-training
por: Aryabumi, Viraat, et al.
Publicado: (2024)
por: Aryabumi, Viraat, et al.
Publicado: (2024)
Prompting with Phonemes: Enhancing LLMs' Multilinguality for Non-Latin Script Languages
por: Nguyen, Hoang H, et al.
Publicado: (2024)
por: Nguyen, Hoang H, et al.
Publicado: (2024)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
por: Zhang, Zhihong, et al.
Publicado: (2025)
por: Zhang, Zhihong, et al.
Publicado: (2025)
Ejemplares similares
-
Verification Limits Code LLM Training
por: Gureja, Srishti, et al.
Publicado: (2025) -
RewardBench 2: Advancing Reward Model Evaluation
por: Malik, Saumya, et al.
Publicado: (2025) -
RewardBench: Evaluating Reward Models for Language Modeling
por: Lambert, Nathan, et al.
Publicado: (2024) -
LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives
por: Shimabucoro, Luísa, et al.
Publicado: (2024) -
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
por: Ma, Qiyao, et al.
Publicado: (2026)