Learn Your Reference Model for Real Good Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Gorbatovski, Alexey, Shaposhnikov, Boris, Malakhov, Alexey, Surnachev, Nikita, Aksenov, Yaroslav, Maksimov, Ian, Balagansky, Nikita, Gavrilov, Daniil |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Linear Transformers with Learnable Kernel Functions are Better In-Context Models
por: Aksenov, Yaroslav, et al.
Publicado: (2024)
por: Aksenov, Yaroslav, et al.
Publicado: (2024)
Analyze Feature Flow to Enhance Interpretation and Steering in Language Models
por: Laptev, Daniil, et al.
Publicado: (2025)
por: Laptev, Daniil, et al.
Publicado: (2025)
Trust-Region Behavior Blending for On-Policy Distillation
por: Plyusov, Daniil, et al.
Publicado: (2026)
por: Plyusov, Daniil, et al.
Publicado: (2026)
Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders
por: Kurochkin, Vadim, et al.
Publicado: (2025)
por: Kurochkin, Vadim, et al.
Publicado: (2025)
The Differences Between Direct Alignment Algorithms are a Blur
por: Gorbatovski, Alexey, et al.
Publicado: (2025)
por: Gorbatovski, Alexey, et al.
Publicado: (2025)
Teach Old SAEs New Domain Tricks with Boosting
por: Koriagin, Nikita, et al.
Publicado: (2025)
por: Koriagin, Nikita, et al.
Publicado: (2025)
You Do Not Fully Utilize Transformer's Representation Capacity
por: Gerasimov, Gleb, et al.
Publicado: (2025)
por: Gerasimov, Gleb, et al.
Publicado: (2025)
Small Vectors, Big Effects: A Mechanistic Study of RL-Induced Reasoning via Steering Vectors
por: Sinii, Viacheslav, et al.
Publicado: (2025)
por: Sinii, Viacheslav, et al.
Publicado: (2025)
ESSA: Evolutionary Strategies for Scalable Alignment
por: Korotyshova, Daria, et al.
Publicado: (2025)
por: Korotyshova, Daria, et al.
Publicado: (2025)
Steering LLM Reasoning Through Bias-Only Adaptation
por: Sinii, Viacheslav, et al.
Publicado: (2025)
por: Sinii, Viacheslav, et al.
Publicado: (2025)
F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
por: Plyusov, Daniil, et al.
Publicado: (2026)
por: Plyusov, Daniil, et al.
Publicado: (2026)
Mechanistic Permutability: Match Features Across Layers
por: Balagansky, Nikita, et al.
Publicado: (2024)
por: Balagansky, Nikita, et al.
Publicado: (2024)
Diffusion Language Models Generation Can Be Halted Early
por: Vaina, Sofia Maria Lo Cicero, et al.
Publicado: (2023)
por: Vaina, Sofia Maria Lo Cicero, et al.
Publicado: (2023)
Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy
por: Balagansky, Nikita, et al.
Publicado: (2025)
por: Balagansky, Nikita, et al.
Publicado: (2025)
Next Embedding Prediction Makes World Models Stronger
por: Bredis, George, et al.
Publicado: (2026)
por: Bredis, George, et al.
Publicado: (2026)
Learning Shortest Paths with Generative Flow Networks
por: Morozov, Nikita, et al.
Publicado: (2026)
por: Morozov, Nikita, et al.
Publicado: (2026)
Commute Your Domains: Trajectory Optimality Criterion for Multi-Domain Learning
por: Rukhovich, Alexey, et al.
Publicado: (2025)
por: Rukhovich, Alexey, et al.
Publicado: (2025)
Revisiting Non-Acyclic GFlowNets in Discrete Environments
por: Morozov, Nikita, et al.
Publicado: (2025)
por: Morozov, Nikita, et al.
Publicado: (2025)
Reinforcement learning for question answering in programming domain using public community scoring as a human feedback
por: Gorbatovski, Alexey, et al.
Publicado: (2024)
por: Gorbatovski, Alexey, et al.
Publicado: (2024)
Guided Star-Shaped Masked Diffusion
por: Meshchaninov, Viacheslav, et al.
Publicado: (2025)
por: Meshchaninov, Viacheslav, et al.
Publicado: (2025)
When an LLM is apprehensive about its answers -- and when its uncertainty is justified
por: Sychev, Petr, et al.
Publicado: (2025)
por: Sychev, Petr, et al.
Publicado: (2025)
Complexity-aware fine-tuning
por: Goncharov, Andrey, et al.
Publicado: (2025)
por: Goncharov, Andrey, et al.
Publicado: (2025)
Developing Lightweight DNN Models With Limited Data For Real-Time Sign Language Recognition
por: Nikitin, Nikita, et al.
Publicado: (2025)
por: Nikitin, Nikita, et al.
Publicado: (2025)
Generative Flow Networks as Entropy-Regularized RL
por: Tiapkin, Daniil, et al.
Publicado: (2023)
por: Tiapkin, Daniil, et al.
Publicado: (2023)
Not All Denoising Steps Are Equal: Model Scheduling for Faster Masked Diffusion Language Models
por: Sedykh, Ivan, et al.
Publicado: (2026)
por: Sedykh, Ivan, et al.
Publicado: (2026)
Review, Remask, Refine (R3): Process-Guided Block Diffusion for Text Generation
por: Mounier, Nikita, et al.
Publicado: (2025)
por: Mounier, Nikita, et al.
Publicado: (2025)
Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
por: Kachaev, Nikita, et al.
Publicado: (2025)
por: Kachaev, Nikita, et al.
Publicado: (2025)
On-Device Collaborative Language Modeling via a Mixture of Generalists and Specialists
por: Fan, Dongyang, et al.
Publicado: (2024)
por: Fan, Dongyang, et al.
Publicado: (2024)
Beyond Simple Averaging: Improving NLP Ensemble Performance with Topological-Data-Analysis-Based Weighting
por: Proskura, Polina, et al.
Publicado: (2024)
por: Proskura, Polina, et al.
Publicado: (2024)
VARAN: Variational Inference for Self-Supervised Speech Models Fine-Tuning on Downstream Tasks
por: Diatlova, Daria, et al.
Publicado: (2025)
por: Diatlova, Daria, et al.
Publicado: (2025)
Hierarchical Embedding Fusion for Retrieval-Augmented Code Generation
por: Sorokin, Nikita, et al.
Publicado: (2026)
por: Sorokin, Nikita, et al.
Publicado: (2026)
Scalable Parameter-Light Spectral Method for Clustering Short Text Embeddings with a Cohesion-Based Evaluation Metric
por: Neveditsin, Nikita, et al.
Publicado: (2025)
por: Neveditsin, Nikita, et al.
Publicado: (2025)
Learning Selective LLM Autonomy from Copilot Feedback in Enterprise Customer Support Workflows
por: Borovkov, Nikita, et al.
Publicado: (2026)
por: Borovkov, Nikita, et al.
Publicado: (2026)
Pairwise Reference Alignment as a Model-Level Ordinal Observable
por: Li, Mujing
Publicado: (2026)
por: Li, Mujing
Publicado: (2026)
L3Cube-MahaSum: A Comprehensive Dataset and BART Models for Abstractive Text Summarization in Marathi
por: Deshmukh, Pranita, et al.
Publicado: (2024)
por: Deshmukh, Pranita, et al.
Publicado: (2024)
SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?
por: Lu, Xudong, et al.
Publicado: (2025)
por: Lu, Xudong, et al.
Publicado: (2025)
Language steering in latent space to mitigate unintended code-switching
por: Goncharov, Andrey, et al.
Publicado: (2025)
por: Goncharov, Andrey, et al.
Publicado: (2025)
Improving GFlowNets with Monte Carlo Tree Search
por: Morozov, Nikita, et al.
Publicado: (2024)
por: Morozov, Nikita, et al.
Publicado: (2024)
SLaNC: Static LayerNorm Calibration
por: Salmani, Mahsa, et al.
Publicado: (2024)
por: Salmani, Mahsa, et al.
Publicado: (2024)
Large Human Language Models: A Need and the Challenges
por: Soni, Nikita, et al.
Publicado: (2023)
por: Soni, Nikita, et al.
Publicado: (2023)
Ejemplares similares
-
Linear Transformers with Learnable Kernel Functions are Better In-Context Models
por: Aksenov, Yaroslav, et al.
Publicado: (2024) -
Analyze Feature Flow to Enhance Interpretation and Steering in Language Models
por: Laptev, Daniil, et al.
Publicado: (2025) -
Trust-Region Behavior Blending for On-Policy Distillation
por: Plyusov, Daniil, et al.
Publicado: (2026) -
Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders
por: Kurochkin, Vadim, et al.
Publicado: (2025) -
The Differences Between Direct Alignment Algorithms are a Blur
por: Gorbatovski, Alexey, et al.
Publicado: (2025)