Feedback Descent: Open-Ended Text Optimization via Pairwise Comparison
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Yoonho, Boen, Joseph, Finn, Chelsea |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Guided Masked Autoencoders for Domain-Agnostic Self-Supervised Learning
par: Xie, Johnathan, et autres
Publié: (2024)
par: Xie, Johnathan, et autres
Publié: (2024)
Conservative Prediction via Data-Driven Confidence Minimization
par: Choi, Caroline, et autres
Publié: (2023)
par: Choi, Caroline, et autres
Publié: (2023)
Test-Time Alignment via Hypothesis Reweighting
par: Lee, Yoonho, et autres
Publié: (2024)
par: Lee, Yoonho, et autres
Publié: (2024)
Clarify: Improving Model Robustness With Natural Language Corrections
par: Lee, Yoonho, et autres
Publié: (2024)
par: Lee, Yoonho, et autres
Publié: (2024)
Calibrating Language Models with Adaptive Temperature Scaling
par: Xie, Johnathan, et autres
Publié: (2024)
par: Xie, Johnathan, et autres
Publié: (2024)
Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling
par: Liu, Yuejiang, et autres
Publié: (2024)
par: Liu, Yuejiang, et autres
Publié: (2024)
AutoFT: Learning an Objective for Robust Fine-Tuning
par: Choi, Caroline, et autres
Publié: (2024)
par: Choi, Caroline, et autres
Publié: (2024)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
par: Qu, Yuxiao, et autres
Publié: (2025)
par: Qu, Yuxiao, et autres
Publié: (2025)
TextGrad: Automatic "Differentiation" via Text
par: Yuksekgonul, Mert, et autres
Publié: (2024)
par: Yuksekgonul, Mert, et autres
Publié: (2024)
Continuum-armed Bandit Optimization with Batch Pairwise Comparison Oracles
par: Chang, Xiangyu, et autres
Publié: (2025)
par: Chang, Xiangyu, et autres
Publié: (2025)
Pairwise Comparisons without Stochastic Transitivity: Model, Theory and Applications
par: Lee, Sze Ming, et autres
Publié: (2025)
par: Lee, Sze Ming, et autres
Publié: (2025)
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
par: Shi, Lucy Xiaoyang, et autres
Publié: (2025)
par: Shi, Lucy Xiaoyang, et autres
Publié: (2025)
Open-Ended Task Discovery via Bayesian Optimization
par: Adachi, Masaki, et autres
Publié: (2026)
par: Adachi, Masaki, et autres
Publié: (2026)
Decoding Decoded: Understanding Hyperparameter Effects in Open-Ended Text Generation
par: Arias, Esteban Garces, et autres
Publié: (2024)
par: Arias, Esteban Garces, et autres
Publié: (2024)
Quantum Natural Stochastic Pairwise Coordinate Descent
par: Sohail, Mohammad Aamir, et autres
Publié: (2024)
par: Sohail, Mohammad Aamir, et autres
Publié: (2024)
Stability-based Generalization Analysis of Randomized Coordinate Descent for Pairwise Learning
par: Wu, Liang, et autres
Publié: (2025)
par: Wu, Liang, et autres
Publié: (2025)
Robust Agents in Open-Ended Worlds
par: Samvelyan, Mikayel
Publié: (2025)
par: Samvelyan, Mikayel
Publié: (2025)
AutoLibra: Agent Metric Induction from Open-Ended Human Feedback
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
Disentangling Length from Quality in Direct Preference Optimization
par: Park, Ryan, et autres
Publié: (2024)
par: Park, Ryan, et autres
Publié: (2024)
Towards Better Open-Ended Text Generation: A Multicriteria Evaluation Framework
par: Arias, Esteban Garces, et autres
Publié: (2024)
par: Arias, Esteban Garces, et autres
Publié: (2024)
Features as Rewards: Scalable Supervision for Open-Ended Tasks via Interpretability
par: Prasad, Aaditya Vikram, et autres
Publié: (2026)
par: Prasad, Aaditya Vikram, et autres
Publié: (2026)
Limited Memory Online Gradient Descent for Kernelized Pairwise Learning with Dynamic Averaging
par: AlQuabeh, Hilal, et autres
Publié: (2024)
par: AlQuabeh, Hilal, et autres
Publié: (2024)
Minimum Weighted Feedback Arc Sets for Ranking from Pairwise Comparisons
par: Vahidi, Soroush, et autres
Publié: (2024)
par: Vahidi, Soroush, et autres
Publié: (2024)
Learning from Similarity/Dissimilarity and Pairwise Comparison
par: Tate, Tomoya, et autres
Publié: (2026)
par: Tate, Tomoya, et autres
Publié: (2026)
FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale
par: He, Runyuan, et autres
Publié: (2026)
par: He, Runyuan, et autres
Publié: (2026)
Automated Feedback in Math Education: A Comparative Analysis of LLMs for Open-Ended Responses
par: Baral, Sami, et autres
Publié: (2024)
par: Baral, Sami, et autres
Publié: (2024)
Adaptive Contrastive Search: Uncertainty-Guided Decoding for Open-Ended Text Generation
par: Arias, Esteban Garces, et autres
Publié: (2024)
par: Arias, Esteban Garces, et autres
Publié: (2024)
Principled Reinforcement Learning with Human Feedback from Pairwise or $K$-wise Comparisons
par: Zhu, Banghua, et autres
Publié: (2023)
par: Zhu, Banghua, et autres
Publié: (2023)
Score-Based Density Estimation from Pairwise Comparisons
par: Mikkola, Petrus, et autres
Publié: (2025)
par: Mikkola, Petrus, et autres
Publié: (2025)
Metric Learning from Limited Pairwise Preference Comparisons
par: Wang, Zhi, et autres
Publié: (2024)
par: Wang, Zhi, et autres
Publié: (2024)
Affordance-Guided Reinforcement Learning via Visual Prompting
par: Lee, Olivia Y., et autres
Publié: (2024)
par: Lee, Olivia Y., et autres
Publié: (2024)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
par: Sharma, Archit, et autres
Publié: (2024)
par: Sharma, Archit, et autres
Publié: (2024)
Reinforcement Learning via Implicit Imitation Guidance
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation
par: Tripathi, Tuhina, et autres
Publié: (2025)
par: Tripathi, Tuhina, et autres
Publié: (2025)
Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options
par: Lee, Joongkyu, et autres
Publié: (2025)
par: Lee, Joongkyu, et autres
Publié: (2025)
Universal Neural Functionals
par: Zhou, Allan, et autres
Publié: (2024)
par: Zhou, Allan, et autres
Publié: (2024)
Accelerating Feedback-based Algorithms for Quantum Optimization Using Gradient Descent
par: Mozakka, Masih, et autres
Publié: (2026)
par: Mozakka, Masih, et autres
Publié: (2026)
Learning Long-Context Diffusion Policies via Past-Token Prediction
par: Torne, Marcel, et autres
Publié: (2025)
par: Torne, Marcel, et autres
Publié: (2025)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
par: Kim, Moo Jin, et autres
Publié: (2025)
par: Kim, Moo Jin, et autres
Publié: (2025)
MemER: Scaling Up Memory for Robot Control via Experience Retrieval
par: Sridhar, Ajay, et autres
Publié: (2025)
par: Sridhar, Ajay, et autres
Publié: (2025)
Documents similaires
-
Self-Guided Masked Autoencoders for Domain-Agnostic Self-Supervised Learning
par: Xie, Johnathan, et autres
Publié: (2024) -
Conservative Prediction via Data-Driven Confidence Minimization
par: Choi, Caroline, et autres
Publié: (2023) -
Test-Time Alignment via Hypothesis Reweighting
par: Lee, Yoonho, et autres
Publié: (2024) -
Clarify: Improving Model Robustness With Natural Language Corrections
par: Lee, Yoonho, et autres
Publié: (2024) -
Calibrating Language Models with Adaptive Temperature Scaling
par: Xie, Johnathan, et autres
Publié: (2024)