Alignment midtraining for animals
Fuente:
arXiv
Salvato in:
| Autori principali: | Brazilek, Jasmine, Tidmarsh, Miles |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Emergent Search and Backtracking in Latent Reasoning Models
di: Cui, Jasmine, et al.
Pubblicazione: (2026)
di: Cui, Jasmine, et al.
Pubblicazione: (2026)
EigenBench: A Comparative Behavioral Measure of Value Alignment
di: Chang, Jonathn, et al.
Pubblicazione: (2025)
di: Chang, Jonathn, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Rare Disease Named Entity Recognition
di: Xi, Nan Miles, et al.
Pubblicazione: (2025)
di: Xi, Nan Miles, et al.
Pubblicazione: (2025)
Investigating Hallucinations in Pruned Large Language Models for Abstractive Summarization
di: Chrysostomou, George, et al.
Pubblicazione: (2023)
di: Chrysostomou, George, et al.
Pubblicazione: (2023)
Alignment for Honesty
di: Yang, Yuqing, et al.
Pubblicazione: (2023)
di: Yang, Yuqing, et al.
Pubblicazione: (2023)
ProgressGym: Alignment with a Millennium of Moral Progress
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
How Far Can In-Context Alignment Go? Exploring the State of In-Context Alignment
di: Huang, Heyan, et al.
Pubblicazione: (2024)
di: Huang, Heyan, et al.
Pubblicazione: (2024)
Training Dynamics of a 1.7B LLaMa Model: A Data-Efficient Approach
di: Li, Miles Q., et al.
Pubblicazione: (2024)
di: Li, Miles Q., et al.
Pubblicazione: (2024)
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning
di: Turpin, Miles, et al.
Pubblicazione: (2025)
di: Turpin, Miles, et al.
Pubblicazione: (2025)
On the Effectiveness of Incremental Training of Large Language Models
di: Li, Miles Q., et al.
Pubblicazione: (2024)
di: Li, Miles Q., et al.
Pubblicazione: (2024)
Constrain Alignment with Sparse Autoencoders
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
Alignment Tuning for Large Language Models: A Data-Centric Lens on Alignment Data Pipelines
di: Song, Hwanjun
Pubblicazione: (2026)
di: Song, Hwanjun
Pubblicazione: (2026)
Societal Alignment Frameworks Can Improve LLM Alignment
di: Stańczak, Karolina, et al.
Pubblicazione: (2025)
di: Stańczak, Karolina, et al.
Pubblicazione: (2025)
Scopes of Alignment
di: Varshney, Kush R., et al.
Pubblicazione: (2025)
di: Varshney, Kush R., et al.
Pubblicazione: (2025)
On the Limitations of Steering in Language Model Alignment
di: Niranjan, Chebrolu, et al.
Pubblicazione: (2025)
di: Niranjan, Chebrolu, et al.
Pubblicazione: (2025)
Word Alignment as Preference for Machine Translation
di: Wu, Qiyu, et al.
Pubblicazione: (2024)
di: Wu, Qiyu, et al.
Pubblicazione: (2024)
Inference-time Alignment in Continuous Space
di: Yuan, Yige, et al.
Pubblicazione: (2025)
di: Yuan, Yige, et al.
Pubblicazione: (2025)
Preference Ranking Optimization for Human Alignment
di: Song, Feifan, et al.
Pubblicazione: (2023)
di: Song, Feifan, et al.
Pubblicazione: (2023)
Extracting and Understanding the Superficial Knowledge in Alignment
di: Chen, Runjin, et al.
Pubblicazione: (2025)
di: Chen, Runjin, et al.
Pubblicazione: (2025)
Agent Alignment in Evolving Social Norms
di: Li, Shimin, et al.
Pubblicazione: (2024)
di: Li, Shimin, et al.
Pubblicazione: (2024)
Anchored Alignment for Self-Explanations Enhancement
di: Villa-Arenas, Luis Felipe, et al.
Pubblicazione: (2024)
di: Villa-Arenas, Luis Felipe, et al.
Pubblicazione: (2024)
Understanding Layer Significance in LLM Alignment
di: Shi, Guangyuan, et al.
Pubblicazione: (2024)
di: Shi, Guangyuan, et al.
Pubblicazione: (2024)
Pluralistic Off-policy Evaluation and Alignment
di: Huang, Chengkai, et al.
Pubblicazione: (2025)
di: Huang, Chengkai, et al.
Pubblicazione: (2025)
Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
Prompt Injection as Role Confusion
di: Ye, Charles, et al.
Pubblicazione: (2026)
di: Ye, Charles, et al.
Pubblicazione: (2026)
The Alignment Bottleneck in Decomposition-Based Claim Verification
di: Akhter, Mahmud Elahi, et al.
Pubblicazione: (2026)
di: Akhter, Mahmud Elahi, et al.
Pubblicazione: (2026)
Cat-DPO: Category-Adaptive Safety Alignment
di: Yang, Tiankai, et al.
Pubblicazione: (2026)
di: Yang, Tiankai, et al.
Pubblicazione: (2026)
Reasoning Pattern Alignment Merging for Adaptive Reasoning
di: Zhong, Zhaofeng, et al.
Pubblicazione: (2026)
di: Zhong, Zhaofeng, et al.
Pubblicazione: (2026)
Exploring Alignment in Shared Cross-lingual Spaces
di: Mousi, Basel, et al.
Pubblicazione: (2024)
di: Mousi, Basel, et al.
Pubblicazione: (2024)
REAL: Response Embedding-based Alignment for LLMs
di: Zhang, Honggen, et al.
Pubblicazione: (2024)
di: Zhang, Honggen, et al.
Pubblicazione: (2024)
Fake Alignment: Are LLMs Really Aligned Well?
di: Wang, Yixu, et al.
Pubblicazione: (2023)
di: Wang, Yixu, et al.
Pubblicazione: (2023)
Fundamental Limitations of Alignment in Large Language Models
di: Wolf, Yotam, et al.
Pubblicazione: (2023)
di: Wolf, Yotam, et al.
Pubblicazione: (2023)
Flames: Benchmarking Value Alignment of LLMs in Chinese
di: Huang, Kexin, et al.
Pubblicazione: (2023)
di: Huang, Kexin, et al.
Pubblicazione: (2023)
Benchmarking Distributional Alignment of Large Language Models
di: Meister, Nicole, et al.
Pubblicazione: (2024)
di: Meister, Nicole, et al.
Pubblicazione: (2024)
Safety Alignment via Constrained Knowledge Unlearning
di: Shi, Zesheng, et al.
Pubblicazione: (2025)
di: Shi, Zesheng, et al.
Pubblicazione: (2025)
PAD: Personalized Alignment of LLMs at Decoding-Time
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
A Practical Analysis of Human Alignment with *PO
di: Ahrabian, Kian, et al.
Pubblicazione: (2024)
di: Ahrabian, Kian, et al.
Pubblicazione: (2024)
SafeWorld: Geo-Diverse Safety Alignment
di: Yin, Da, et al.
Pubblicazione: (2024)
di: Yin, Da, et al.
Pubblicazione: (2024)
Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching
di: Miles, Roy, et al.
Pubblicazione: (2026)
di: Miles, Roy, et al.
Pubblicazione: (2026)
Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
di: Brito, Iago Alves, et al.
Pubblicazione: (2026)
di: Brito, Iago Alves, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Emergent Search and Backtracking in Latent Reasoning Models
di: Cui, Jasmine, et al.
Pubblicazione: (2026) -
EigenBench: A Comparative Behavioral Measure of Value Alignment
di: Chang, Jonathn, et al.
Pubblicazione: (2025) -
Leveraging Large Language Models for Rare Disease Named Entity Recognition
di: Xi, Nan Miles, et al.
Pubblicazione: (2025) -
Investigating Hallucinations in Pruned Large Language Models for Abstractive Summarization
di: Chrysostomou, George, et al.
Pubblicazione: (2023) -
Alignment for Honesty
di: Yang, Yuqing, et al.
Pubblicazione: (2023)