CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Wenbo, Majumdar, Aditya, Yadav, Amulya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The Hardness of Achieving Impact in AI for Social Impact Research: A Ground-Level View of Challenges & Opportunities
por: Majumdar, Aditya, et al.
Publicado: (2025)
por: Majumdar, Aditya, et al.
Publicado: (2025)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
por: Bansal, Hritik, et al.
Publicado: (2023)
por: Bansal, Hritik, et al.
Publicado: (2023)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
por: Zhang, Shun, et al.
Publicado: (2024)
por: Zhang, Shun, et al.
Publicado: (2024)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback
por: Zheng, Qinqing, et al.
Publicado: (2024)
por: Zheng, Qinqing, et al.
Publicado: (2024)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
por: Sharma, Archit, et al.
Publicado: (2024)
por: Sharma, Archit, et al.
Publicado: (2024)
RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs
por: Wu, Jiaxing, et al.
Publicado: (2024)
por: Wu, Jiaxing, et al.
Publicado: (2024)
DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning
por: Karaman, Batuhan K., et al.
Publicado: (2026)
por: Karaman, Batuhan K., et al.
Publicado: (2026)
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
por: Lee, Harrison, et al.
Publicado: (2023)
por: Lee, Harrison, et al.
Publicado: (2023)
Probing the Decision Boundaries of In-context Learning in Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2024)
por: Zhao, Siyan, et al.
Publicado: (2024)
UltraFeedback: Boosting Language Models with Scaled AI Feedback
por: Cui, Ganqu, et al.
Publicado: (2023)
por: Cui, Ganqu, et al.
Publicado: (2023)
LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback
por: Mura, Raffaele, et al.
Publicado: (2025)
por: Mura, Raffaele, et al.
Publicado: (2025)
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
por: Dong, Guanting, et al.
Publicado: (2024)
por: Dong, Guanting, et al.
Publicado: (2024)
Reasoning Elicitation in Language Models via Counterfactual Feedback
por: Hüyük, Alihan, et al.
Publicado: (2024)
por: Hüyük, Alihan, et al.
Publicado: (2024)
Improving Code Generation by Training with Natural Language Feedback
por: Chen, Angelica, et al.
Publicado: (2023)
por: Chen, Angelica, et al.
Publicado: (2023)
Speaking the Same Language: Leveraging LLMs in Standardizing Clinical Data for AI
por: Sett, Arindam, et al.
Publicado: (2024)
por: Sett, Arindam, et al.
Publicado: (2024)
CHAI: Command Hijacking against embodied AI
por: Burbano, Luis, et al.
Publicado: (2025)
por: Burbano, Luis, et al.
Publicado: (2025)
RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
por: Chaudhari, Shreyas, et al.
Publicado: (2024)
por: Chaudhari, Shreyas, et al.
Publicado: (2024)
Reinforcement Learning with Backtracking Feedback
por: Sel, Bilgehan, et al.
Publicado: (2026)
por: Sel, Bilgehan, et al.
Publicado: (2026)
A Multilingual Sentiment Lexicon for Low-Resource Language Translation using Large Languages Models and Explainable AI
por: Malinga, Melusi, et al.
Publicado: (2024)
por: Malinga, Melusi, et al.
Publicado: (2024)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
por: Wang, Zizhao, et al.
Publicado: (2025)
por: Wang, Zizhao, et al.
Publicado: (2025)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
por: Butt, Natasha, et al.
Publicado: (2024)
por: Butt, Natasha, et al.
Publicado: (2024)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
por: Pang, Jing-Cheng, et al.
Publicado: (2024)
por: Pang, Jing-Cheng, et al.
Publicado: (2024)
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
por: Zhuang, Yuchen, et al.
Publicado: (2025)
por: Zhuang, Yuchen, et al.
Publicado: (2025)
Improving Large Language Model Safety with Contrastive Representation Learning
por: Simko, Samuel, et al.
Publicado: (2025)
por: Simko, Samuel, et al.
Publicado: (2025)
Steering Large Language Models for Machine Translation Personalization
por: Scalena, Daniel, et al.
Publicado: (2025)
por: Scalena, Daniel, et al.
Publicado: (2025)
Rethinking Data Mixing from the Perspective of Large Language Models
por: Xu, Yuanjian, et al.
Publicado: (2026)
por: Xu, Yuanjian, et al.
Publicado: (2026)
Creating and Evaluating Code-Mixed Nepali-English and Telugu-English Datasets for Abusive Language Detection Using Traditional and Deep Learning Models
por: Pandey, Manish, et al.
Publicado: (2025)
por: Pandey, Manish, et al.
Publicado: (2025)
VietMix: A Naturally-Occurring Parallel Corpus and Augmentation Framework for Vietnamese-English Code-Mixed Machine Translation
por: Tran, Hieu, et al.
Publicado: (2025)
por: Tran, Hieu, et al.
Publicado: (2025)
Paraphrase and Aggregate with Large Language Models for Minimizing Intent Classification Errors
por: Yadav, Vikas, et al.
Publicado: (2024)
por: Yadav, Vikas, et al.
Publicado: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
por: Anschel, Oron, et al.
Publicado: (2025)
por: Anschel, Oron, et al.
Publicado: (2025)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)
por: Tao, Yongding, et al.
Publicado: (2025)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2023)
por: Zhao, Siyan, et al.
Publicado: (2023)
Distributionally Robust Reinforcement Learning with Human Feedback
por: Mandal, Debmalya, et al.
Publicado: (2025)
por: Mandal, Debmalya, et al.
Publicado: (2025)
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
Reinforcement Learning Enhanced LLMs: A Survey
por: Wang, Shuhe, et al.
Publicado: (2024)
por: Wang, Shuhe, et al.
Publicado: (2024)
Parameter Efficient Reinforcement Learning from Human Feedback
por: Sidahmed, Hakim, et al.
Publicado: (2024)
por: Sidahmed, Hakim, et al.
Publicado: (2024)
Ensemble Learning for Large Language Models in Text and Code Generation: A Survey
por: Ashiga, Mari, et al.
Publicado: (2025)
por: Ashiga, Mari, et al.
Publicado: (2025)
Code Simulation Challenges for Large Language Models
por: La Malfa, Emanuele, et al.
Publicado: (2024)
por: La Malfa, Emanuele, et al.
Publicado: (2024)
Ejemplares similares
-
The Hardness of Achieving Impact in AI for Social Impact Research: A Ground-Level View of Challenges & Opportunities
por: Majumdar, Aditya, et al.
Publicado: (2025) -
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
por: Bansal, Hritik, et al.
Publicado: (2023) -
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
por: Zhang, Shun, et al.
Publicado: (2024) -
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2024) -
Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback
por: Zheng, Qinqing, et al.
Publicado: (2024)