PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Oh, Jihwan, Oh, Soowon, Aghazada, Murad, Jeong, Minchan, Kim, Sungnyun, Yun, Se-Young |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MERIT Feedback Elicits Better Bargaining in LLM Negotiators
par: Oh, Jihwan, et autres
Publié: (2026)
par: Oh, Jihwan, et autres
Publié: (2026)
From Belief Entrenchment to Robust Reasoning in LLM Agents
par: Oh, Jihwan, et autres
Publié: (2025)
par: Oh, Jihwan, et autres
Publié: (2025)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
par: Lee, Gihun, et autres
Publié: (2024)
par: Lee, Gihun, et autres
Publié: (2024)
Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators
par: Ko, Jongwoo, et autres
Publié: (2025)
par: Ko, Jongwoo, et autres
Publié: (2025)
DistiLLM: Towards Streamlined Distillation for Large Language Models
par: Ko, Jongwoo, et autres
Publié: (2024)
par: Ko, Jongwoo, et autres
Publié: (2024)
Learning to Verify Summary Facts with Fine-Grained LLM Feedback
par: Oh, Jihwan, et autres
Publié: (2024)
par: Oh, Jihwan, et autres
Publié: (2024)
Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning
par: Oh, Jihwan, et autres
Publié: (2024)
par: Oh, Jihwan, et autres
Publié: (2024)
FedDr+: Stabilizing Dot-regression with Global Feature Distillation for Federated Learning
par: Kim, Seongyoon, et autres
Publié: (2024)
par: Kim, Seongyoon, et autres
Publié: (2024)
FedSOL: Stabilized Orthogonal Learning with Proximal Restrictions in Federated Learning
par: Lee, Gihun, et autres
Publié: (2023)
par: Lee, Gihun, et autres
Publié: (2023)
Bayesian Multi-Task Transfer Learning for Soft Prompt Tuning
par: Lee, Haeju, et autres
Publié: (2024)
par: Lee, Haeju, et autres
Publié: (2024)
VorTEX: Various overlap ratio for Target speech EXtraction
par: Oh, Ro-hoon, et autres
Publié: (2026)
par: Oh, Ro-hoon, et autres
Publié: (2026)
Exploring Persona-dependent LLM Alignment for the Moral Machine Experiment
par: Kim, Jiseon, et autres
Publié: (2025)
par: Kim, Jiseon, et autres
Publié: (2025)
DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs
par: Ko, Jongwoo, et autres
Publié: (2025)
par: Ko, Jongwoo, et autres
Publié: (2025)
ReFeed: Multi-dimensional Summarization Refinement with Reflective Reasoning on Feedback
par: Yun, Taewon, et autres
Publié: (2025)
par: Yun, Taewon, et autres
Publié: (2025)
Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generation
par: Shin, Jisu, et autres
Publié: (2025)
par: Shin, Jisu, et autres
Publié: (2025)
RLPR: Extrapolating RLVR to General Domains without Verifiers
par: Yu, Tianyu, et autres
Publié: (2025)
par: Yu, Tianyu, et autres
Publié: (2025)
Uncovering Factor Level Preferences to Improve Human-Model Alignment
par: Oh, Juhyun, et autres
Publié: (2024)
par: Oh, Juhyun, et autres
Publié: (2024)
Contextual Linear Bandits under Noisy Features: Towards Bayesian Oracles
par: Kim, Jung-hun, et autres
Publié: (2017)
par: Kim, Jung-hun, et autres
Publié: (2017)
Learning Video Temporal Dynamics with Cross-Modal Attention for Robust Audio-Visual Speech Recognition
par: Kim, Sungnyun, et autres
Publié: (2024)
par: Kim, Sungnyun, et autres
Publié: (2024)
MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition
par: Kim, Sungnyun, et autres
Publié: (2025)
par: Kim, Sungnyun, et autres
Publié: (2025)
mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT
par: Koh, Woosung, et autres
Publié: (2026)
par: Koh, Woosung, et autres
Publié: (2026)
Learning to Summarize from LLM-generated Feedback
par: Song, Hwanjun, et autres
Publié: (2024)
par: Song, Hwanjun, et autres
Publié: (2024)
Preference Alignment with Flow Matching
par: Kim, Minu, et autres
Publié: (2024)
par: Kim, Minu, et autres
Publié: (2024)
VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models
par: Kim, Woojin, et autres
Publié: (2026)
par: Kim, Woojin, et autres
Publié: (2026)
Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards
par: Da, Jeff, et autres
Publié: (2025)
par: Da, Jeff, et autres
Publié: (2025)
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
par: Shen, Yiran, et autres
Publié: (2025)
par: Shen, Yiran, et autres
Publié: (2025)
Multi-Drafter Speculative Decoding with Alignment Feedback
par: Kim, Taehyeon, et autres
Publié: (2026)
par: Kim, Taehyeon, et autres
Publié: (2026)
MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation
par: Cho, Sungwoo, et autres
Publié: (2025)
par: Cho, Sungwoo, et autres
Publié: (2025)
Confidence Regularized Masked Language Modeling using Text Length
par: Ji, Seunghyun, et autres
Publié: (2025)
par: Ji, Seunghyun, et autres
Publié: (2025)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
par: Chen, Kun, et autres
Publié: (2026)
par: Chen, Kun, et autres
Publié: (2026)
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
par: Chen, Guanzheng, et autres
Publié: (2026)
par: Chen, Guanzheng, et autres
Publié: (2026)
Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses
par: Kim, Sungnyun, et autres
Publié: (2025)
par: Kim, Sungnyun, et autres
Publié: (2025)
GECKO: Generative Language Model for English, Code and Korean
par: Oh, Sungwoo, et autres
Publié: (2024)
par: Oh, Sungwoo, et autres
Publié: (2024)
AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
par: Koh, Woosung, et autres
Publié: (2025)
par: Koh, Woosung, et autres
Publié: (2025)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR
par: Khalifa, Muhammad, et autres
Publié: (2026)
par: Khalifa, Muhammad, et autres
Publié: (2026)
Scalable Frameworks for Real-World Audio-Visual Speech Recognition
par: Kim, Sungnyun
Publié: (2025)
par: Kim, Sungnyun
Publié: (2025)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
par: Helff, Lukas, et autres
Publié: (2026)
par: Helff, Lukas, et autres
Publié: (2026)
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
par: Guo, Weiyang, et autres
Publié: (2026)
par: Guo, Weiyang, et autres
Publié: (2026)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
par: Liu, Xiaoyuan, et autres
Publié: (2025)
par: Liu, Xiaoyuan, et autres
Publié: (2025)
Documents similaires
-
MERIT Feedback Elicits Better Bargaining in LLM Negotiators
par: Oh, Jihwan, et autres
Publié: (2026) -
From Belief Entrenchment to Robust Reasoning in LLM Agents
par: Oh, Jihwan, et autres
Publié: (2025) -
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
par: Lee, Gihun, et autres
Publié: (2024) -
Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators
par: Ko, Jongwoo, et autres
Publié: (2025) -
DistiLLM: Towards Streamlined Distillation for Large Language Models
par: Ko, Jongwoo, et autres
Publié: (2024)