SGPO: Self-Generated Preference Optimization based on Self-Improver
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Hyeonji, Jo, Daejin, Yun, Seohwan, Kim, Sungwoong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025)
por: Jo, Daejin, et al.
Publicado: (2025)
Hexa: Self-Improving for Knowledge-Grounded Dialogue System
por: Jo, Daejin, et al.
Publicado: (2023)
por: Jo, Daejin, et al.
Publicado: (2023)
Self-Supervised Transformers as Iterative Solution Improvers for Constraint Satisfaction
por: Xu, Yudong W., et al.
Publicado: (2025)
por: Xu, Yudong W., et al.
Publicado: (2025)
Mitigating Length Bias in RLHF through a Causal Lens
por: Kim, Hyeonji, et al.
Publicado: (2025)
por: Kim, Hyeonji, et al.
Publicado: (2025)
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
por: Yoon, Hee Suk, et al.
Publicado: (2025)
por: Yoon, Hee Suk, et al.
Publicado: (2025)
Model-based Preference Optimization in Abstractive Summarization without Human Feedback
por: Choi, Jaepill, et al.
Publicado: (2024)
por: Choi, Jaepill, et al.
Publicado: (2024)
Database Normalization via Dual-LLM Self-Refinement
por: Jo, Eunjae, et al.
Publicado: (2025)
por: Jo, Eunjae, et al.
Publicado: (2025)
Self-Consistency Preference Optimization
por: Prasad, Archiki, et al.
Publicado: (2024)
por: Prasad, Archiki, et al.
Publicado: (2024)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
TSO: Self-Training with Scaled Preference Optimization
por: Chen, Kaihui, et al.
Publicado: (2024)
por: Chen, Kaihui, et al.
Publicado: (2024)
Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention
por: Mo, Shibing, et al.
Publicado: (2025)
por: Mo, Shibing, et al.
Publicado: (2025)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
por: Gupta, Taneesh, et al.
Publicado: (2025)
por: Gupta, Taneesh, et al.
Publicado: (2025)
Mitigating Attention Localization in Small Scale: Self-Attention Refinement via One-step Belief Propagation
por: Lee, Nakyung, et al.
Publicado: (2025)
por: Lee, Nakyung, et al.
Publicado: (2025)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
por: Rosset, Corby, et al.
Publicado: (2024)
por: Rosset, Corby, et al.
Publicado: (2024)
Mitigating Self-Preference by Authorship Obfuscation
por: Mahbub, Taslim, et al.
Publicado: (2025)
por: Mahbub, Taslim, et al.
Publicado: (2025)
CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations
por: Zhang, Mike, et al.
Publicado: (2026)
por: Zhang, Mike, et al.
Publicado: (2026)
Self-Play Preference Optimization for Language Model Alignment
por: Wu, Yue, et al.
Publicado: (2024)
por: Wu, Yue, et al.
Publicado: (2024)
Preference Consistency Matters: Enhancing Preference Learning in Language Models with Automated Self-Curation of Training Corpora
por: Lee, JoonHo, et al.
Publicado: (2024)
por: Lee, JoonHo, et al.
Publicado: (2024)
DialSim: A Dialogue Simulator for Evaluating Long-Term Multi-Party Dialogue Understanding of Conversational Agents
por: Kim, Jiho, et al.
Publicado: (2024)
por: Kim, Jiho, et al.
Publicado: (2024)
Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM
por: Chi, Donghwan, et al.
Publicado: (2025)
por: Chi, Donghwan, et al.
Publicado: (2025)
Retrieval-Augmented Fine-Tuning With Preference Optimization For Visual Program Generation
por: Kang, Deokhyung, et al.
Publicado: (2025)
por: Kang, Deokhyung, et al.
Publicado: (2025)
SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification
por: Yoon, Kanghoon, et al.
Publicado: (2025)
por: Yoon, Kanghoon, et al.
Publicado: (2025)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
por: Lee, Gihun, et al.
Publicado: (2024)
por: Lee, Gihun, et al.
Publicado: (2024)
Self-supervised Attribute-aware Dynamic Preference Ranking Alignment
por: Yang, Hongyu, et al.
Publicado: (2025)
por: Yang, Hongyu, et al.
Publicado: (2025)
Self-Boosting Large Language Models with Synthetic Preference Data
por: Dong, Qingxiu, et al.
Publicado: (2024)
por: Dong, Qingxiu, et al.
Publicado: (2024)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
por: Singh, Joykirat, et al.
Publicado: (2025)
por: Singh, Joykirat, et al.
Publicado: (2025)
SSFO: Self-Supervised Faithfulness Optimization for Retrieval-Augmented Generation
por: Tang, Xiaqiang, et al.
Publicado: (2025)
por: Tang, Xiaqiang, et al.
Publicado: (2025)
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
por: Pombal, José, et al.
Publicado: (2026)
por: Pombal, José, et al.
Publicado: (2026)
Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation
por: Zelikman, Eric, et al.
Publicado: (2023)
por: Zelikman, Eric, et al.
Publicado: (2023)
ORPO: Monolithic Preference Optimization without Reference Model
por: Hong, Jiwoo, et al.
Publicado: (2024)
por: Hong, Jiwoo, et al.
Publicado: (2024)
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
por: Xu, Kaishuai, et al.
Publicado: (2024)
por: Xu, Kaishuai, et al.
Publicado: (2024)
Multi-Faceted Self-Consistent Preference Alignment for Query Rewriting in Conversational Search
por: Cao, Zhiyu, et al.
Publicado: (2026)
por: Cao, Zhiyu, et al.
Publicado: (2026)
AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
por: Koh, Woosung, et al.
Publicado: (2025)
por: Koh, Woosung, et al.
Publicado: (2025)
LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked
por: Phute, Mansi, et al.
Publicado: (2023)
por: Phute, Mansi, et al.
Publicado: (2023)
Verbalized Confidence Triggers Self-Verification: Emergent Behavior Without Explicit Reasoning Supervision
por: Jang, Chaeyun, et al.
Publicado: (2025)
por: Jang, Chaeyun, et al.
Publicado: (2025)
EHRSQL: A Practical Text-to-SQL Benchmark for Electronic Health Records
por: Lee, Gyubok, et al.
Publicado: (2023)
por: Lee, Gyubok, et al.
Publicado: (2023)
Generating Plausible Distractors for Multiple-Choice Questions via Student Choice Prediction
por: Lee, Yooseop, et al.
Publicado: (2025)
por: Lee, Yooseop, et al.
Publicado: (2025)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
por: Wang, Yilong, et al.
Publicado: (2026)
por: Wang, Yilong, et al.
Publicado: (2026)
Quantifying and Mitigating Self-Preference Bias of LLM Judges
por: Yang, Jinming, et al.
Publicado: (2026)
por: Yang, Jinming, et al.
Publicado: (2026)
In-N-Out: A Parameter-Level API Graph Dataset for Tool Agents
por: Lee, Seungkyu, et al.
Publicado: (2025)
por: Lee, Seungkyu, et al.
Publicado: (2025)
Ejemplares similares
-
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025) -
Hexa: Self-Improving for Knowledge-Grounded Dialogue System
por: Jo, Daejin, et al.
Publicado: (2023) -
Self-Supervised Transformers as Iterative Solution Improvers for Constraint Satisfaction
por: Xu, Yudong W., et al.
Publicado: (2025) -
Mitigating Length Bias in RLHF through a Causal Lens
por: Kim, Hyeonji, et al.
Publicado: (2025) -
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
por: Yoon, Hee Suk, et al.
Publicado: (2025)