Many of Your DPOs are Secretly One: Attempting Unification Through Mutual Information
Fuente:
arXiv
Salvato in:
| Autori principali: | Tutnov, Rasul, Grosnit, Antoine, Bou-Ammar, Haitham |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Why Can Large Language Models Generate Correct Chain-of-Thoughts?
di: Tutunov, Rasul, et al.
Pubblicazione: (2023)
di: Tutunov, Rasul, et al.
Pubblicazione: (2023)
Contextual Causal Bayesian Optimisation
di: Arsenyan, Vahan, et al.
Pubblicazione: (2023)
di: Arsenyan, Vahan, et al.
Pubblicazione: (2023)
ShortCircuit: AlphaZero-Driven Circuit Design
di: Tsaras, Dimitrios, et al.
Pubblicazione: (2024)
di: Tsaras, Dimitrios, et al.
Pubblicazione: (2024)
SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
di: Christopoulou, Fenia, et al.
Pubblicazione: (2024)
di: Christopoulou, Fenia, et al.
Pubblicazione: (2024)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
di: Ji, Xiaotong, et al.
Pubblicazione: (2025)
di: Ji, Xiaotong, et al.
Pubblicazione: (2025)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
di: Wieser, Frederico, et al.
Pubblicazione: (2025)
di: Wieser, Frederico, et al.
Pubblicazione: (2025)
Untangling Component Imbalance in Hybrid Linear Attention Conversion Methods
di: Benfeghoul, Martin, et al.
Pubblicazione: (2025)
di: Benfeghoul, Martin, et al.
Pubblicazione: (2025)
Decoding as Optimisation on the Probability Simplex: From Top-K to Top-P (Nucleus) to Best-of-K Samplers
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
Group Robust Preference Optimization in Reward-free RLHF
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
SuRe: Surprise-Driven Prioritised Replay for Continual LLM Learning
di: Hazard, Hugo, et al.
Pubblicazione: (2025)
di: Hazard, Hugo, et al.
Pubblicazione: (2025)
It Takes Two: Your GRPO Is Secretly DPO
di: Wu, Yihong, et al.
Pubblicazione: (2025)
di: Wu, Yihong, et al.
Pubblicazione: (2025)
Your Transformer is Secretly Linear
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024)
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024)
Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning
di: Bourigault, Pauline, et al.
Pubblicazione: (2026)
di: Bourigault, Pauline, et al.
Pubblicazione: (2026)
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
di: Li, Ziyue, et al.
Pubblicazione: (2024)
di: Li, Ziyue, et al.
Pubblicazione: (2024)
The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling
di: Nguyen, Tu, et al.
Pubblicazione: (2026)
di: Nguyen, Tu, et al.
Pubblicazione: (2026)
The $\mathbf{Y}$-Combinator for LLMs: Solving Long-Context Rot with $λ$-Calculus
di: Roy, Amartya, et al.
Pubblicazione: (2026)
di: Roy, Amartya, et al.
Pubblicazione: (2026)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2026)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2026)
Al-Khwarizmi: Discovering Physical Laws with Foundation Models
di: Mower, Christopher E., et al.
Pubblicazione: (2025)
di: Mower, Christopher E., et al.
Pubblicazione: (2025)
Human-inspired Episodic Memory for Infinite Context LLMs
di: Fountas, Zafeirios, et al.
Pubblicazione: (2024)
di: Fountas, Zafeirios, et al.
Pubblicazione: (2024)
Model-Based and Sample-Efficient AI-Assisted Math Discovery in Sphere Packing
di: Tutunov, Rasul, et al.
Pubblicazione: (2025)
di: Tutunov, Rasul, et al.
Pubblicazione: (2025)
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
di: Ou, Jingyang, et al.
Pubblicazione: (2024)
di: Ou, Jingyang, et al.
Pubblicazione: (2024)
Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline
di: Lee, Tony, et al.
Pubblicazione: (2026)
di: Lee, Tony, et al.
Pubblicazione: (2026)
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior
di: Doyle, Cooper
Pubblicazione: (2025)
di: Doyle, Cooper
Pubblicazione: (2025)
Flextron: Many-in-One Flexible Large Language Model
di: Cai, Ruisi, et al.
Pubblicazione: (2024)
di: Cai, Ruisi, et al.
Pubblicazione: (2024)
Bourbaki: Self-Generated and Goal-Conditioned MDPs for Theorem Proving
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
Out of One, Many: Using Language Models to Simulate Human Samples
di: Argyle, Lisa P., et al.
Pubblicazione: (2022)
di: Argyle, Lisa P., et al.
Pubblicazione: (2022)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
di: Rafailov, Rafael, et al.
Pubblicazione: (2023)
di: Rafailov, Rafael, et al.
Pubblicazione: (2023)
Intrinsic Mutual Information as a Modulator for Preference Optimization
di: Liao, Peng, et al.
Pubblicazione: (2026)
di: Liao, Peng, et al.
Pubblicazione: (2026)
Many Minds from One Model: Bayesian-Inspired Transformers for Population Diversity
di: Yang, Diji, et al.
Pubblicazione: (2025)
di: Yang, Diji, et al.
Pubblicazione: (2025)
Check Your LLM's Secret Dictionary! Five Lines of Code Reveal What Your LLM Learned (Including What It Shouldn't Have)
di: Miyashita, Hisashi
Pubblicazione: (2026)
di: Miyashita, Hisashi
Pubblicazione: (2026)
Share Your Attention: Transformer Weight Sharing via Matrix-based Dictionary Learning
di: Zhussip, Magauiya, et al.
Pubblicazione: (2025)
di: Zhussip, Magauiya, et al.
Pubblicazione: (2025)
LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
Efficient RLVR Training via Weighted Mutual Information Data Selection
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
BitDelta: Your Fine-Tune May Only Be Worth One Bit
di: Liu, James, et al.
Pubblicazione: (2024)
di: Liu, James, et al.
Pubblicazione: (2024)
One Goal, Many Challenges: Robust Preference Optimization Amid Content-Aware and Multi-Source Noise
di: Afzali, Amirabbas, et al.
Pubblicazione: (2025)
di: Afzali, Amirabbas, et al.
Pubblicazione: (2025)
STENCIL: Submodular Mutual Information Based Weak Supervision for Cold-Start Active Learning
di: Beck, Nathan, et al.
Pubblicazione: (2024)
di: Beck, Nathan, et al.
Pubblicazione: (2024)
Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
di: Yao, Jiashu, et al.
Pubblicazione: (2026)
di: Yao, Jiashu, et al.
Pubblicazione: (2026)
Learning from Failures in Multi-Attempt Reinforcement Learning
di: Chung, Stephen, et al.
Pubblicazione: (2025)
di: Chung, Stephen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Why Can Large Language Models Generate Correct Chain-of-Thoughts?
di: Tutunov, Rasul, et al.
Pubblicazione: (2023) -
Contextual Causal Bayesian Optimisation
di: Arsenyan, Vahan, et al.
Pubblicazione: (2023) -
ShortCircuit: AlphaZero-Driven Circuit Design
di: Tsaras, Dimitrios, et al.
Pubblicazione: (2024) -
SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
di: Christopoulou, Fenia, et al.
Pubblicazione: (2024) -
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)