The Differences Between Direct Alignment Algorithms are a Blur
Fuente:
arXiv
Salvato in:
| Autori principali: | Gorbatovski, Alexey, Shaposhnikov, Boris, Sinii, Viacheslav, Malakhov, Alexey, Gavrilov, Daniil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
di: Plyusov, Daniil, et al.
Pubblicazione: (2026)
di: Plyusov, Daniil, et al.
Pubblicazione: (2026)
ESSA: Evolutionary Strategies for Scalable Alignment
di: Korotyshova, Daria, et al.
Pubblicazione: (2025)
di: Korotyshova, Daria, et al.
Pubblicazione: (2025)
Steering LLM Reasoning Through Bias-Only Adaptation
di: Sinii, Viacheslav, et al.
Pubblicazione: (2025)
di: Sinii, Viacheslav, et al.
Pubblicazione: (2025)
Trust-Region Behavior Blending for On-Policy Distillation
di: Plyusov, Daniil, et al.
Pubblicazione: (2026)
di: Plyusov, Daniil, et al.
Pubblicazione: (2026)
Learn Your Reference Model for Real Good Alignment
di: Gorbatovski, Alexey, et al.
Pubblicazione: (2024)
di: Gorbatovski, Alexey, et al.
Pubblicazione: (2024)
Small Vectors, Big Effects: A Mechanistic Study of RL-Induced Reasoning via Steering Vectors
di: Sinii, Viacheslav, et al.
Pubblicazione: (2025)
di: Sinii, Viacheslav, et al.
Pubblicazione: (2025)
Linear Transformers with Learnable Kernel Functions are Better In-Context Models
di: Aksenov, Yaroslav, et al.
Pubblicazione: (2024)
di: Aksenov, Yaroslav, et al.
Pubblicazione: (2024)
You Do Not Fully Utilize Transformer's Representation Capacity
di: Gerasimov, Gleb, et al.
Pubblicazione: (2025)
di: Gerasimov, Gleb, et al.
Pubblicazione: (2025)
Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success
di: Bredis, George, et al.
Pubblicazione: (2025)
di: Bredis, George, et al.
Pubblicazione: (2025)
Improved High-Probability Bounds for the Temporal Difference Learning Algorithm via Exponential Stability
di: Samsonov, Sergey, et al.
Pubblicazione: (2023)
di: Samsonov, Sergey, et al.
Pubblicazione: (2023)
Emergence of In-Context Reinforcement Learning from Noise Distillation
di: Zisman, Ilya, et al.
Pubblicazione: (2023)
di: Zisman, Ilya, et al.
Pubblicazione: (2023)
Mechanistic Permutability: Match Features Across Layers
di: Balagansky, Nikita, et al.
Pubblicazione: (2024)
di: Balagansky, Nikita, et al.
Pubblicazione: (2024)
Uncertainty Estimation of Transformers' Predictions via Topological Analysis of the Attention Matrices
di: Kostenok, Elizaveta, et al.
Pubblicazione: (2023)
di: Kostenok, Elizaveta, et al.
Pubblicazione: (2023)
Analyze Feature Flow to Enhance Interpretation and Steering in Language Models
di: Laptev, Daniil, et al.
Pubblicazione: (2025)
di: Laptev, Daniil, et al.
Pubblicazione: (2025)
In-Context Reinforcement Learning for Variable Action Spaces
di: Sinii, Viacheslav, et al.
Pubblicazione: (2023)
di: Sinii, Viacheslav, et al.
Pubblicazione: (2023)
XLand-MiniGrid: Scalable Meta-Reinforcement Learning Environments in JAX
di: Nikulin, Alexander, et al.
Pubblicazione: (2023)
di: Nikulin, Alexander, et al.
Pubblicazione: (2023)
Evaluating Robustness in Latent Diffusion Models via Embedding Level Augmentation
di: Martirosyan, Boris, et al.
Pubblicazione: (2025)
di: Martirosyan, Boris, et al.
Pubblicazione: (2025)
Guided Star-Shaped Masked Diffusion
di: Meshchaninov, Viacheslav, et al.
Pubblicazione: (2025)
di: Meshchaninov, Viacheslav, et al.
Pubblicazione: (2025)
Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders
di: Kurochkin, Vadim, et al.
Pubblicazione: (2025)
di: Kurochkin, Vadim, et al.
Pubblicazione: (2025)
Accelerating Transformers in Online RL
di: Zelezetsky, Daniil, et al.
Pubblicazione: (2025)
di: Zelezetsky, Daniil, et al.
Pubblicazione: (2025)
Generative Flow Networks as Entropy-Regularized RL
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
Reinforcement learning for question answering in programming domain using public community scoring as a human feedback
di: Gorbatovski, Alexey, et al.
Pubblicazione: (2024)
di: Gorbatovski, Alexey, et al.
Pubblicazione: (2024)
Next Embedding Prediction Makes World Models Stronger
di: Bredis, George, et al.
Pubblicazione: (2026)
di: Bredis, George, et al.
Pubblicazione: (2026)
Ensemble-based graph representation of fMRI data for cognitive brain state classification
di: Vlasenko, Daniil, et al.
Pubblicazione: (2025)
di: Vlasenko, Daniil, et al.
Pubblicazione: (2025)
Method for noise-induced regularization in quantum neural networks
di: Kuzmin, Viacheslav, et al.
Pubblicazione: (2024)
di: Kuzmin, Viacheslav, et al.
Pubblicazione: (2024)
Diffusion Language Models Generation Can Be Halted Early
di: Vaina, Sofia Maria Lo Cicero, et al.
Pubblicazione: (2023)
di: Vaina, Sofia Maria Lo Cicero, et al.
Pubblicazione: (2023)
N-Gram Induction Heads for In-Context RL: Improving Stability and Reducing Data Needs
di: Zisman, Ilya, et al.
Pubblicazione: (2024)
di: Zisman, Ilya, et al.
Pubblicazione: (2024)
Teach Old SAEs New Domain Tricks with Boosting
di: Koriagin, Nikita, et al.
Pubblicazione: (2025)
di: Koriagin, Nikita, et al.
Pubblicazione: (2025)
Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy
di: Balagansky, Nikita, et al.
Pubblicazione: (2025)
di: Balagansky, Nikita, et al.
Pubblicazione: (2025)
When an LLM is apprehensive about its answers -- and when its uncertainty is justified
di: Sychev, Petr, et al.
Pubblicazione: (2025)
di: Sychev, Petr, et al.
Pubblicazione: (2025)
Variance Reduction Methods Do Not Need to Compute Full Gradients: Improved Efficiency through Shuffling
di: Medyakov, Daniil, et al.
Pubblicazione: (2025)
di: Medyakov, Daniil, et al.
Pubblicazione: (2025)
Re:Frame -- Retrieving Experience From Associative Memory
di: Zelezetsky, Daniil, et al.
Pubblicazione: (2025)
di: Zelezetsky, Daniil, et al.
Pubblicazione: (2025)
Complexity-aware fine-tuning
di: Goncharov, Andrey, et al.
Pubblicazione: (2025)
di: Goncharov, Andrey, et al.
Pubblicazione: (2025)
Improving GFlowNets with Monte Carlo Tree Search
di: Morozov, Nikita, et al.
Pubblicazione: (2024)
di: Morozov, Nikita, et al.
Pubblicazione: (2024)
On (not) learning the Möbius function
di: Pozdnyakov, Alexey
Pubblicazione: (2026)
di: Pozdnyakov, Alexey
Pubblicazione: (2026)
The Euler characteristic of a triangulated manifold in terms of even-dimensional faces
di: Gavrilov, Alexey V.
Pubblicazione: (2025)
di: Gavrilov, Alexey V.
Pubblicazione: (2025)
On Efficient Scaling of GNNs via IO-Aware Layers Implementations
di: Fomina, Daria, et al.
Pubblicazione: (2026)
di: Fomina, Daria, et al.
Pubblicazione: (2026)
Soft-Quantum Algorithms
di: Kyriacou, Basil, et al.
Pubblicazione: (2026)
di: Kyriacou, Basil, et al.
Pubblicazione: (2026)
UVIP: Model-Free Approach to Evaluate Reinforcement Learning Algorithms
di: Belomestny, Denis, et al.
Pubblicazione: (2021)
di: Belomestny, Denis, et al.
Pubblicazione: (2021)
GoalLadder: Incremental Goal Discovery with Vision-Language Models
di: Zakharov, Alexey, et al.
Pubblicazione: (2025)
di: Zakharov, Alexey, et al.
Pubblicazione: (2025)
Documenti analoghi
-
F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
di: Plyusov, Daniil, et al.
Pubblicazione: (2026) -
ESSA: Evolutionary Strategies for Scalable Alignment
di: Korotyshova, Daria, et al.
Pubblicazione: (2025) -
Steering LLM Reasoning Through Bias-Only Adaptation
di: Sinii, Viacheslav, et al.
Pubblicazione: (2025) -
Trust-Region Behavior Blending for On-Policy Distillation
di: Plyusov, Daniil, et al.
Pubblicazione: (2026) -
Learn Your Reference Model for Real Good Alignment
di: Gorbatovski, Alexey, et al.
Pubblicazione: (2024)