Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bansal, Hritik, Suvarna, Ashima, Bhatt, Gantavya, Peng, Nanyun, Chang, Kai-Wei, Grover, Aditya |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
par: Bansal, Hritik, et autres
Publié: (2023)
par: Bansal, Hritik, et autres
Publié: (2023)
PhonologyBench: Evaluating Phonological Skills of Large Language Models
par: Suvarna, Ashima, et autres
Publié: (2024)
par: Suvarna, Ashima, et autres
Publié: (2024)
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models
par: Wadhawan, Rohan, et autres
Publié: (2024)
par: Wadhawan, Rohan, et autres
Publié: (2024)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
QUDSELECT: Selective Decoding for Questions Under Discussion Parsing
par: Suvarna, Ashima, et autres
Publié: (2024)
par: Suvarna, Ashima, et autres
Publié: (2024)
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
par: Suvarna, Ashima, et autres
Publié: (2026)
par: Suvarna, Ashima, et autres
Publié: (2026)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
Improving Event Definition Following For Zero-Shot Event Detection
par: Cai, Zefan, et autres
Publié: (2024)
par: Cai, Zefan, et autres
Publié: (2024)
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation
par: Bansal, Hritik, et autres
Publié: (2025)
par: Bansal, Hritik, et autres
Publié: (2025)
GenEARL: A Training-Free Generative Framework for Multimodal Event Argument Role Labeling
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Survey of Bias In Text-to-Image Generation: Definition, Evaluation, and Mitigation
par: Wan, Yixin, et autres
Publié: (2024)
par: Wan, Yixin, et autres
Publié: (2024)
HoneyBee: Data Recipes for Vision-Language Reasoners
par: Bansal, Hritik, et autres
Publié: (2025)
par: Bansal, Hritik, et autres
Publié: (2025)
Apples and Oranges and ARL Statistics.
par: Stubbs, Kendon
Publié: (1988)
par: Stubbs, Kendon
Publié: (1988)
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
par: Singhi, Nishad, et autres
Publié: (2025)
par: Singhi, Nishad, et autres
Publié: (2025)
LaViDa: A Large Diffusion Language Model for Multimodal Understanding
par: Li, Shufan, et autres
Publié: (2025)
par: Li, Shufan, et autres
Publié: (2025)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
par: Zhao, Siyan, et autres
Publié: (2023)
par: Zhao, Siyan, et autres
Publié: (2023)
Two Ways to Set Up Wireless Hotspot: Comparing Apples and Oranges
par: Mutch, Andrew, et autres
Publié: (2006)
par: Mutch, Andrew, et autres
Publié: (2006)
Comparing Apples to Oranges: A Taxonomy for Navigating the Global Landscape of AI Regulation
par: Alanoca, Sacha, et autres
Publié: (2025)
par: Alanoca, Sacha, et autres
Publié: (2025)
MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Control Large Language Models via Divide and Conquer
par: Li, Bingxuan, et autres
Publié: (2024)
par: Li, Bingxuan, et autres
Publié: (2024)
Comparing Apples to Oranges: LLM-powered Multimodal Intention Prediction in an Object Categorization Task
par: Ali, Hassan, et autres
Publié: (2024)
par: Ali, Hassan, et autres
Publié: (2024)
LICO: Large Language Models for In-Context Molecular Optimization
par: Nguyen, Tung, et autres
Publié: (2024)
par: Nguyen, Tung, et autres
Publié: (2024)
In Comparison: Apples and Oranges and Lemons? Online Elementary Periodical Indices.
par: Levetan, Janice
Publié: (1999)
par: Levetan, Janice
Publié: (1999)
Correction to “Comparing Apples to Manzanas and Oranges to Naranjas: A New Measure of English‐Spanish Vocabulary for Dual Language Learners”
Publié: (2025)
Publié: (2025)
Deep Submodular Peripteral Networks
par: Bhatt, Gantavya, et autres
Publié: (2024)
par: Bhatt, Gantavya, et autres
Publié: (2024)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
par: Wu, Xueqing, et autres
Publié: (2026)
par: Wu, Xueqing, et autres
Publié: (2026)
Peeking Behind Closed Doors: Risks of LLM Evaluation by Private Data Curators
par: Bansal, Hritik, et autres
Publié: (2025)
par: Bansal, Hritik, et autres
Publié: (2025)
VideoPhy: Evaluating Physical Commonsense for Video Generation
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Comparing Apples to Oranges: A Dataset & Analysis of LLM Humour Understanding from Traditional Puns to Topical Jokes
par: Loakman, Tyler, et autres
Publié: (2025)
par: Loakman, Tyler, et autres
Publié: (2025)
Pullback and Direct Image of Parabolic Ample and Parabolic Nef Vector Bundles
par: Bansal, Ashima, et autres
Publié: (2026)
par: Bansal, Ashima, et autres
Publié: (2026)
LLM-A*: Large Language Model Enhanced Incremental Heuristic Search on Path Planning
par: Meng, Silin, et autres
Publié: (2024)
par: Meng, Silin, et autres
Publié: (2024)
Apples, Oranges, and Software Engineering: Study Selection Challenges for Secondary Research on Latent Variables
par: Wyrich, Marvin, et autres
Publié: (2024)
par: Wyrich, Marvin, et autres
Publié: (2024)
Bad Values but Good Behavior: Learning Highly Misspecified Bandits and MDPs
par: Banerjee, Debangshu, et autres
Publié: (2023)
par: Banerjee, Debangshu, et autres
Publié: (2023)
How Much Is a Dataset Worth? Scaling Laws, the Vendi Score, and Matrix Spectral Functions
par: Bilmes, Jeff A., et autres
Publié: (2026)
par: Bilmes, Jeff A., et autres
Publié: (2026)
REAL Sampling: Boosting Factuality and Diversity of Open-Ended Generation via Asymptotic Entropy
par: Chang, Haw-Shiuan, et autres
Publié: (2024)
par: Chang, Haw-Shiuan, et autres
Publié: (2024)
CoKe: Customizable Fine-Grained Story Evaluation via Chain-of-Keyword Rationalization
par: Joshi, Brihi, et autres
Publié: (2025)
par: Joshi, Brihi, et autres
Publié: (2025)
PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
par: Li, Shufan, et autres
Publié: (2025)
par: Li, Shufan, et autres
Publié: (2025)
Matryoshka Query Transformer for Large Vision-Language Models
par: Hu, Wenbo, et autres
Publié: (2024)
par: Hu, Wenbo, et autres
Publié: (2024)
A Comparative Analysis of Earnings Between Internal Return Migrants and Nonmigrants in India
par: Vasavi Bhatt, et autres
Publié: (2025)
par: Vasavi Bhatt, et autres
Publié: (2025)
Scaling transformer neural networks for skillful and reliable medium-range weather forecasting
par: Nguyen, Tung, et autres
Publié: (2023)
par: Nguyen, Tung, et autres
Publié: (2023)
Documents similaires
-
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
par: Bansal, Hritik, et autres
Publié: (2023) -
PhonologyBench: Evaluating Phonological Skills of Large Language Models
par: Suvarna, Ashima, et autres
Publié: (2024) -
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models
par: Wadhawan, Rohan, et autres
Publié: (2024) -
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
par: Bansal, Hritik, et autres
Publié: (2024) -
QUDSELECT: Selective Decoding for Questions Under Discussion Parsing
par: Suvarna, Ashima, et autres
Publié: (2024)