ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Yoon, Hee Suk, Yoon, Eunseop, Hasegawa-Johnson, Mark, Kim, Sungwoong, Yoo, Chang D. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models
por: Yoon, Eunseop, et al.
Publicado: (2025)
por: Yoon, Eunseop, et al.
Publicado: (2025)
LI-TTA: Language Informed Test-Time Adaptation for Automatic Speech Recognition
por: Yoon, Eunseop, et al.
Publicado: (2024)
por: Yoon, Eunseop, et al.
Publicado: (2024)
TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback
por: Yoon, Eunseop, et al.
Publicado: (2024)
por: Yoon, Eunseop, et al.
Publicado: (2024)
PACR: Progressively Ascending Confidence Reward for LLM Reasoning
por: Yoon, Eunseop, et al.
Publicado: (2025)
por: Yoon, Eunseop, et al.
Publicado: (2025)
PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
por: Yoon, Hee Suk, et al.
Publicado: (2026)
por: Yoon, Hee Suk, et al.
Publicado: (2026)
C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion
por: Yoon, Hee Suk, et al.
Publicado: (2024)
por: Yoon, Hee Suk, et al.
Publicado: (2024)
HEAR: Hearing Enhanced Audio Response for Video-grounded Dialogue
por: Yoon, Sunjae, et al.
Publicado: (2023)
por: Yoon, Sunjae, et al.
Publicado: (2023)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
por: Yoon, Hee Suk, et al.
Publicado: (2026)
por: Yoon, Hee Suk, et al.
Publicado: (2026)
AdaMER-CTC: Connectionist Temporal Classification with Adaptive Maximum Entropy Regularization for Automatic Speech Recognition
por: Eom, SooHwan, et al.
Publicado: (2024)
por: Eom, SooHwan, et al.
Publicado: (2024)
ESD: Expected Squared Difference as a Tuning-Free Trainable Calibration Measure
por: Yoon, Hee Suk, et al.
Publicado: (2023)
por: Yoon, Hee Suk, et al.
Publicado: (2023)
SimPSI: A Simple Strategy to Preserve Spectral Information in Time Series Data Augmentation
por: Ryu, Hyun, et al.
Publicado: (2023)
por: Ryu, Hyun, et al.
Publicado: (2023)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
por: Yoon, Sunjae, et al.
Publicado: (2022)
por: Yoon, Sunjae, et al.
Publicado: (2022)
TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation
por: Fodeh, Samah, et al.
Publicado: (2026)
por: Fodeh, Samah, et al.
Publicado: (2026)
SGPO: Self-Generated Preference Optimization based on Self-Improver
por: Lee, Hyeonji, et al.
Publicado: (2025)
por: Lee, Hyeonji, et al.
Publicado: (2025)
SteerConf: Steering LLMs for Confidence Elicitation
por: Zhou, Ziang, et al.
Publicado: (2025)
por: Zhou, Ziang, et al.
Publicado: (2025)
ConfRAG: Confidence-Guided Retrieval-Augmenting Generation
por: Huang, Yin, et al.
Publicado: (2025)
por: Huang, Yin, et al.
Publicado: (2025)
High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding
por: Hong, Ji Woo, et al.
Publicado: (2026)
por: Hong, Ji Woo, et al.
Publicado: (2026)
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
por: Li, Yibo, et al.
Publicado: (2025)
por: Li, Yibo, et al.
Publicado: (2025)
BI-MDRG: Bridging Image History in Multimodal Dialogue Response Generation
por: Yoon, Hee Suk, et al.
Publicado: (2024)
por: Yoon, Hee Suk, et al.
Publicado: (2024)
Latent Preference Modeling for Cross-Session Personalized Tool Calling
por: Yoon, Yejin, et al.
Publicado: (2026)
por: Yoon, Yejin, et al.
Publicado: (2026)
MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Models
por: Xue, Boyang, et al.
Publicado: (2024)
por: Xue, Boyang, et al.
Publicado: (2024)
MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Models
por: Xue, Boyang, et al.
Publicado: (2024)
por: Xue, Boyang, et al.
Publicado: (2024)
M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following
por: Gao, Ruirui, et al.
Publicado: (2025)
por: Gao, Ruirui, et al.
Publicado: (2025)
BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents
por: Ou, Litu, et al.
Publicado: (2025)
por: Ou, Litu, et al.
Publicado: (2025)
ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
por: Zhang, Bonan, et al.
Publicado: (2025)
por: Zhang, Bonan, et al.
Publicado: (2025)
ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding
por: Amer, Walaa, et al.
Publicado: (2026)
por: Amer, Walaa, et al.
Publicado: (2026)
Reasoning Models Better Express Their Confidence
por: Yoon, Dongkeun, et al.
Publicado: (2025)
por: Yoon, Dongkeun, et al.
Publicado: (2025)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025)
por: Jo, Daejin, et al.
Publicado: (2025)
Semantic Token Reweighting for Interpretable and Controllable Text Embeddings in CLIP
por: Kim, Eunji, et al.
Publicado: (2024)
por: Kim, Eunji, et al.
Publicado: (2024)
ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification
por: Liu, Siran, et al.
Publicado: (2026)
por: Liu, Siran, et al.
Publicado: (2026)
PrefPO: Pairwise Preference Prompt Optimization
por: Singhal, Rahul, et al.
Publicado: (2026)
por: Singhal, Rahul, et al.
Publicado: (2026)
Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
por: Kim, Sungkyun, et al.
Publicado: (2025)
por: Kim, Sungkyun, et al.
Publicado: (2025)
Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language Models
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
KnowPO: Knowledge-aware Preference Optimization for Controllable Knowledge Selection in Retrieval-Augmented Language Models
por: Zhang, Ruizhe, et al.
Publicado: (2024)
por: Zhang, Ruizhe, et al.
Publicado: (2024)
Beyond Learning: A Training-Free Alternative to Model Adaptation
por: Yoon, Namkyung, et al.
Publicado: (2026)
por: Yoon, Namkyung, et al.
Publicado: (2026)
Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences
por: Shrivastava, Vaishnavi, et al.
Publicado: (2025)
por: Shrivastava, Vaishnavi, et al.
Publicado: (2025)
QE-EBM: Using Quality Estimators as Energy Loss for Machine Translation
por: Yoo, Gahyun, et al.
Publicado: (2024)
por: Yoo, Gahyun, et al.
Publicado: (2024)
FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
por: Liu, Tong, et al.
Publicado: (2025)
por: Liu, Tong, et al.
Publicado: (2025)
BenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMs
por: Yoon, Sangyeon, et al.
Publicado: (2026)
por: Yoon, Sangyeon, et al.
Publicado: (2026)
CAPO: Confidence Aware Preference Optimization Learning for Multilingual Preferences
por: Pokharel, Rhitabrat, et al.
Publicado: (2025)
por: Pokharel, Rhitabrat, et al.
Publicado: (2025)
Ejemplares similares
-
Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models
por: Yoon, Eunseop, et al.
Publicado: (2025) -
LI-TTA: Language Informed Test-Time Adaptation for Automatic Speech Recognition
por: Yoon, Eunseop, et al.
Publicado: (2024) -
TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback
por: Yoon, Eunseop, et al.
Publicado: (2024) -
PACR: Progressively Ascending Confidence Reward for LLM Reasoning
por: Yoon, Eunseop, et al.
Publicado: (2025) -
PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
por: Yoon, Hee Suk, et al.
Publicado: (2026)