PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Wonjoong, In, Yeonjun, Park, Sangwu, Lee, Dongha, Park, Chanyoung |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
by: Kim, Wonjoong, et al.
Published: (2025)
by: Kim, Wonjoong, et al.
Published: (2025)
Reasoning Structure Matters for Safety Alignment of Reasoning Models
by: In, Yeonjun, et al.
Published: (2026)
by: In, Yeonjun, et al.
Published: (2026)
R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
by: In, Yeonjun, et al.
Published: (2025)
by: In, Yeonjun, et al.
Published: (2025)
Personalize-then-Store: Benchmarking and Learning Personalized Memory for Long-horizon Agents
by: In, Yeonjun, et al.
Published: (2026)
by: In, Yeonjun, et al.
Published: (2026)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
by: Kim, Wonjoong, et al.
Published: (2024)
by: Kim, Wonjoong, et al.
Published: (2024)
Rethinking Failure Attribution in Multi-Agent Systems: A Multi-Perspective Benchmark and Evaluation
by: In, Yeonjun, et al.
Published: (2026)
by: In, Yeonjun, et al.
Published: (2026)
Self-EvolveRec: Self-Evolving Recommender Systems with LLM-based Directional Feedback
by: Kim, Sein, et al.
Published: (2026)
by: Kim, Sein, et al.
Published: (2026)
DSLR: Diversity Enhancement and Structure Learning for Rehearsal-based Graph Continual Learning
by: Choi, Seungyoon, et al.
Published: (2024)
by: Choi, Seungyoon, et al.
Published: (2024)
Test-Time Training for Visual Foresight Vision-Language-Action Models
by: Park, Sangwu, et al.
Published: (2026)
by: Park, Sangwu, et al.
Published: (2026)
Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions
by: Lee, Jeongeun, et al.
Published: (2026)
by: Lee, Jeongeun, et al.
Published: (2026)
Is Safety Standard Same for Everyone? User-Specific Safety Evaluation of Large Language Models
by: In, Yeonjun, et al.
Published: (2025)
by: In, Yeonjun, et al.
Published: (2025)
CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space
by: Hwang, Yeonjun, et al.
Published: (2026)
by: Hwang, Yeonjun, et al.
Published: (2026)
Revisiting Fake News Detection: Towards Temporality-aware Evaluation by Leveraging Engagement Earliness
by: Kim, Junghoon, et al.
Published: (2024)
by: Kim, Junghoon, et al.
Published: (2024)
Adaptive Self-training Framework for Fine-grained Scene Graph Generation
by: Kim, Kibum, et al.
Published: (2024)
by: Kim, Kibum, et al.
Published: (2024)
LLM4SGG: Large Language Models for Weakly Supervised Scene Graph Generation
by: Kim, Kibum, et al.
Published: (2023)
by: Kim, Kibum, et al.
Published: (2023)
IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
by: Noh, Heewoong, et al.
Published: (2025)
by: Noh, Heewoong, et al.
Published: (2025)
SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification
by: Yoon, Kanghoon, et al.
Published: (2025)
by: Yoon, Kanghoon, et al.
Published: (2025)
Vision Language Model is NOT All You Need: Augmentation Strategies for Molecule Language Models
by: Lee, Namkyeong, et al.
Published: (2024)
by: Lee, Namkyeong, et al.
Published: (2024)
Personalized Reward Modeling for Text-to-Image Generation
by: Lee, Jeongeun, et al.
Published: (2025)
by: Lee, Jeongeun, et al.
Published: (2025)
Interpretable Prototype-based Graph Information Bottleneck
by: Seo, Sangwoo, et al.
Published: (2023)
by: Seo, Sangwoo, et al.
Published: (2023)
Machine Collective Intelligence for Explainable Scientific Discovery
by: Na, Gyoung S., et al.
Published: (2026)
by: Na, Gyoung S., et al.
Published: (2026)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
by: Kim, Sunghwan, et al.
Published: (2025)
by: Kim, Sunghwan, et al.
Published: (2025)
Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History
by: Kim, Serin, et al.
Published: (2026)
by: Kim, Serin, et al.
Published: (2026)
Token-Efficient Item Representation via Images for LLM Recommender Systems
by: Kim, Kibum, et al.
Published: (2025)
by: Kim, Kibum, et al.
Published: (2025)
MSP-LLM: A Unified Large Language Model Framework for Complete Material Synthesis Planning
by: Noh, Heewoong, et al.
Published: (2026)
by: Noh, Heewoong, et al.
Published: (2026)
OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models
by: Kim, Jaehoon, et al.
Published: (2026)
by: Kim, Jaehoon, et al.
Published: (2026)
Adaptive Graph Rewiring to Mitigate Over-Squashing in Mesh-Based GNNs for Fluid Dynamics Simulations
by: Seo, Sangwoo, et al.
Published: (2025)
by: Seo, Sangwoo, et al.
Published: (2025)
PrefixAgent: An LLM-Powered Design Framework for Efficient Prefix Adder Optimization
by: Zuo, Dongsheng, et al.
Published: (2025)
by: Zuo, Dongsheng, et al.
Published: (2025)
RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair
by: Rachapudi, Jagadeesh, et al.
Published: (2026)
by: Rachapudi, Jagadeesh, et al.
Published: (2026)
Disentangling Hyperedges through the Lens of Category Theory
by: Lee, Yoonho, et al.
Published: (2025)
by: Lee, Yoonho, et al.
Published: (2025)
Detecting Prefix Bias in LLM-based Reward Models
by: Kumar, Ashwin, et al.
Published: (2025)
by: Kumar, Ashwin, et al.
Published: (2025)
Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration
by: Modecrua, Wachiravit, et al.
Published: (2026)
by: Modecrua, Wachiravit, et al.
Published: (2026)
Electron-Informed Coarse-Graining Molecular Representation Learning for Real-World Molecular Physics
by: Na, Gyoung S., et al.
Published: (2026)
by: Na, Gyoung S., et al.
Published: (2026)
Unsupervised Episode Generation for Graph Meta-learning
by: Jung, Jihyeong, et al.
Published: (2023)
by: Jung, Jihyeong, et al.
Published: (2023)
MobiCLR: Mobility Time Series Contrastive Learning for Urban Region Representations
by: Kim, Namwoo, et al.
Published: (2025)
by: Kim, Namwoo, et al.
Published: (2025)
Region4Web: Rethinking Observation Space Granularity for Web Agents
by: Kwon, Donguk, et al.
Published: (2026)
by: Kwon, Donguk, et al.
Published: (2026)
Progressive Multi-Agent Reasoning for Biological Perturbation Prediction
by: Kim, Hyomin, et al.
Published: (2026)
by: Kim, Hyomin, et al.
Published: (2026)
Retrieval-Retro: Retrieval-based Inorganic Retrosynthesis with Expert Knowledge
by: Noh, Heewoong, et al.
Published: (2024)
by: Noh, Heewoong, et al.
Published: (2024)
CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
by: Kim, Jiwan, et al.
Published: (2025)
by: Kim, Jiwan, et al.
Published: (2025)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
by: Zhong, Haitian, et al.
Published: (2026)
by: Zhong, Haitian, et al.
Published: (2026)
Similar Items
-
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
by: Kim, Wonjoong, et al.
Published: (2025) -
Reasoning Structure Matters for Safety Alignment of Reasoning Models
by: In, Yeonjun, et al.
Published: (2026) -
R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
by: In, Yeonjun, et al.
Published: (2025) -
Personalize-then-Store: Benchmarking and Learning Personalized Memory for Long-horizon Agents
by: In, Yeonjun, et al.
Published: (2026) -
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
by: Kim, Wonjoong, et al.
Published: (2024)