Guardado en:
| Autor principal: | Frank, Gregory N. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.04385 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails
por: Frank, Gregory N.
Publicado: (2026)
por: Frank, Gregory N.
Publicado: (2026)
Stepwise Alignment for Constrained Language Model Policy Optimization
por: Wachi, Akifumi, et al.
Publicado: (2024)
por: Wachi, Akifumi, et al.
Publicado: (2024)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
por: Zhang, Songming, et al.
Publicado: (2025)
por: Zhang, Songming, et al.
Publicado: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
por: Li, Chengao, et al.
Publicado: (2025)
por: Li, Chengao, et al.
Publicado: (2025)
Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling
por: Amin, Adil
Publicado: (2026)
por: Amin, Adil
Publicado: (2026)
Analytic Subspace Routing: How Recursive Least Squares Works in Continual Learning of Large Language Model
por: Tong, Kai, et al.
Publicado: (2025)
por: Tong, Kai, et al.
Publicado: (2025)
Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits
por: Patel, Dev, et al.
Publicado: (2025)
por: Patel, Dev, et al.
Publicado: (2025)
SynapseRoute: An Auto-Route Switching Framework on Dual-State Large Language Model
por: Zhang, Wencheng, et al.
Publicado: (2025)
por: Zhang, Wencheng, et al.
Publicado: (2025)
Unfamiliar Finetuning Examples Control How Language Models Hallucinate
por: Kang, Katie, et al.
Publicado: (2024)
por: Kang, Katie, et al.
Publicado: (2024)
Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment
por: Pustejovsky, James, et al.
Publicado: (2026)
por: Pustejovsky, James, et al.
Publicado: (2026)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
por: Jin, Haoran, et al.
Publicado: (2025)
por: Jin, Haoran, et al.
Publicado: (2025)
Routoo: Learning to Route to Large Language Models Effectively
por: Mohammadshahi, Alireza, et al.
Publicado: (2024)
por: Mohammadshahi, Alireza, et al.
Publicado: (2024)
MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models
por: Saha, Partha Pratim, et al.
Publicado: (2026)
por: Saha, Partha Pratim, et al.
Publicado: (2026)
TARo: Token-level Adaptive Routing for LLM Test-time Alignment
por: Rai, Arushi, et al.
Publicado: (2026)
por: Rai, Arushi, et al.
Publicado: (2026)
BertaQA: How Much Do Language Models Know About Local Culture?
por: Etxaniz, Julen, et al.
Publicado: (2024)
por: Etxaniz, Julen, et al.
Publicado: (2024)
On the Robustness of Reward Models for Language Model Alignment
por: Hong, Jiwoo, et al.
Publicado: (2025)
por: Hong, Jiwoo, et al.
Publicado: (2025)
Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models
por: Puerto, Haritz, et al.
Publicado: (2024)
por: Puerto, Haritz, et al.
Publicado: (2024)
Baby Scale: Investigating Models Trained on Individual Children's Language Input
por: Feng, Steven Y., et al.
Publicado: (2026)
por: Feng, Steven Y., et al.
Publicado: (2026)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
por: Rafailov, Rafael, et al.
Publicado: (2024)
por: Rafailov, Rafael, et al.
Publicado: (2024)
Revisiting In-context Learning Inference Circuit in Large Language Models
por: Cho, Hakaze, et al.
Publicado: (2024)
por: Cho, Hakaze, et al.
Publicado: (2024)
Pareto Multi-Objective Alignment for Language Models
por: He, Qiang, et al.
Publicado: (2025)
por: He, Qiang, et al.
Publicado: (2025)
Evolutionary Contrastive Distillation for Language Model Alignment
por: Katz-Samuels, Julian, et al.
Publicado: (2024)
por: Katz-Samuels, Julian, et al.
Publicado: (2024)
On the Entropy Calibration of Language Models
por: Cao, Steven, et al.
Publicado: (2025)
por: Cao, Steven, et al.
Publicado: (2025)
Learning to Route for Dynamic Adapter Composition in Continual Learning with Language Models
por: Araujo, Vladimir, et al.
Publicado: (2024)
por: Araujo, Vladimir, et al.
Publicado: (2024)
VL-RouterBench: A Benchmark for Vision-Language Model Routing
por: Huang, Zhehao, et al.
Publicado: (2025)
por: Huang, Zhehao, et al.
Publicado: (2025)
How Prompts Move Language Model Behavior: Frames, Salience, and Construal as Semantic Control
por: Kim, Dongseok, et al.
Publicado: (2025)
por: Kim, Dongseok, et al.
Publicado: (2025)
Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference
por: Kim, Geonhee, et al.
Publicado: (2024)
por: Kim, Geonhee, et al.
Publicado: (2024)
Task-Circuit Quantization: Leveraging Knowledge Localization and Interpretability for Compression
por: Xiao, Hanqi, et al.
Publicado: (2025)
por: Xiao, Hanqi, et al.
Publicado: (2025)
How Uncertainty Estimation Scales with Sampling in Reasoning Models
por: Del, Maksym, et al.
Publicado: (2026)
por: Del, Maksym, et al.
Publicado: (2026)
Can Large Language Models Solve Robot Routing?
por: Huang, Zhehui, et al.
Publicado: (2024)
por: Huang, Zhehui, et al.
Publicado: (2024)
Binary Classifier Optimization for Large Language Model Alignment
por: Jung, Seungjae, et al.
Publicado: (2024)
por: Jung, Seungjae, et al.
Publicado: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
por: He, Jiafan, et al.
Publicado: (2024)
por: He, Jiafan, et al.
Publicado: (2024)
Self-Play Preference Optimization for Language Model Alignment
por: Wu, Yue, et al.
Publicado: (2024)
por: Wu, Yue, et al.
Publicado: (2024)
Probabilistic Token Alignment for Large Language Model Fusion
por: Zeng, Runjia, et al.
Publicado: (2025)
por: Zeng, Runjia, et al.
Publicado: (2025)
Rethinking the Role of Proxy Rewards in Language Model Alignment
por: Kim, Sungdong, et al.
Publicado: (2024)
por: Kim, Sungdong, et al.
Publicado: (2024)
Value Augmented Sampling for Language Model Alignment and Personalization
por: Han, Seungwook, et al.
Publicado: (2024)
por: Han, Seungwook, et al.
Publicado: (2024)
Spectral Editing of Activations for Large Language Model Alignment
por: Qiu, Yifu, et al.
Publicado: (2024)
por: Qiu, Yifu, et al.
Publicado: (2024)
Bringing Up a Bilingual BabyLM: Investigating Multilingual Language Acquisition Using Small-Scale Models
por: Zeng, Linda, et al.
Publicado: (2026)
por: Zeng, Linda, et al.
Publicado: (2026)
Scaling Embeddings Outperforms Scaling Experts in Language Models
por: Liu, Hong, et al.
Publicado: (2026)
por: Liu, Hong, et al.
Publicado: (2026)
Reviving The Classics: Active Reward Modeling in Large Language Model Alignment
por: Shen, Yunyi, et al.
Publicado: (2025)
por: Shen, Yunyi, et al.
Publicado: (2025)
Ejemplares similares
-
Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails
por: Frank, Gregory N.
Publicado: (2026) -
Stepwise Alignment for Constrained Language Model Policy Optimization
por: Wachi, Akifumi, et al.
Publicado: (2024) -
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
por: Zhang, Songming, et al.
Publicado: (2025) -
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
por: Li, Chengao, et al.
Publicado: (2025) -
Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling
por: Amin, Adil
Publicado: (2026)