AI Alignment: A Comprehensive Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Ji, Jiaming, Qiu, Tianyi, Chen, Boyuan, Zhang, Borong, Lou, Hantao, Wang, Kaile, Duan, Yawen, He, Zhonghao, Vierling, Lukas, Hong, Donghai, Zhou, Jiayi, Zhang, Zhaowei, Zeng, Fanzhi, Dai, Juntao, Pan, Xuehai, Ng, Kwan Yee, O'Gara, Aidan, Xu, Hua, Tse, Brian, Fu, Jie, McAleer, Stephen, Yang, Yaodong, Wang, Yizhou, Zhu, Song-Chun, Guo, Yike, Gao, Wen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Aligner: Efficient Alignment by Learning to Correct
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
di: Lou, Hantao, et al.
Pubblicazione: (2025)
di: Lou, Hantao, et al.
Pubblicazione: (2025)
Plato's 'Republic'
di: McAleer, Sean
Pubblicazione: (2020)
di: McAleer, Sean
Pubblicazione: (2020)
Mitigating Deceptive Alignment via Self-Monitoring
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
Reward Generalization in RLHF: A Topological Perspective
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
Language Models Resist Alignment: Evidence From Data Compression
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Hemicrania continua exacerbations with prodromal burping as a potential autonomic symptom
di: Raluca A. Negulescu, et al.
Pubblicazione: (2026)
di: Raluca A. Negulescu, et al.
Pubblicazione: (2026)
Faster Game Solving via Hyperparameter Schedules
di: Zhang, Naifeng, et al.
Pubblicazione: (2024)
di: Zhang, Naifeng, et al.
Pubblicazione: (2024)
Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
di: Fang, Sitong, et al.
Pubblicazione: (2025)
di: Fang, Sitong, et al.
Pubblicazione: (2025)
Actor–Partner Model of Parenting and Co‐Parenting Practices and Youth Resilience During the COVID‐19 Pandemic
di: Olivia Aspiras, et al.
Pubblicazione: (2025)
di: Olivia Aspiras, et al.
Pubblicazione: (2025)
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
Sample-Efficient Regret-Minimizing Double Oracle in Extensive-Form Games
di: Tang, Xiaohang, et al.
Pubblicazione: (2024)
di: Tang, Xiaohang, et al.
Pubblicazione: (2024)
A Systematic Review to Explore Antenatal Care From the Perspectives of Women With Intellectual Disabilities and Midwives
di: Weam Alhulaibi, et al.
Pubblicazione: (2024)
di: Weam Alhulaibi, et al.
Pubblicazione: (2024)
Biased rate estimates in bump-hunt searches
di: Murray, William, et al.
Pubblicazione: (2025)
di: Murray, William, et al.
Pubblicazione: (2025)
SafeDreamer: Safe Reinforcement Learning with World Models
di: Huang, Weidong, et al.
Pubblicazione: (2023)
di: Huang, Weidong, et al.
Pubblicazione: (2023)
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
di: Zhang, Yuhao, et al.
Pubblicazione: (2026)
di: Zhang, Yuhao, et al.
Pubblicazione: (2026)
Activities of Garlic Oil, Garlic Powder, and Their Diallyl Constituents against Helicobacter pylori
di: O'Gara E.A. Hilld.J and Maslin D.J
Pubblicazione: (2000)
di: O'Gara E.A. Hilld.J and Maslin D.J
Pubblicazione: (2000)
Game-Theoretic Multiagent Reinforcement Learning
di: Yang, Yaodong, et al.
Pubblicazione: (2020)
di: Yang, Yaodong, et al.
Pubblicazione: (2020)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
di: Zhang, Borong, et al.
Pubblicazione: (2025)
di: Zhang, Borong, et al.
Pubblicazione: (2025)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
di: Lou, Hantao, et al.
Pubblicazione: (2025)
di: Lou, Hantao, et al.
Pubblicazione: (2025)
Orienting and Engaging New Faculty
di: Pamela MacRae, et al.
Pubblicazione: (2024)
di: Pamela MacRae, et al.
Pubblicazione: (2024)
Tree Search for Language Model Agents
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
Trajectory-Oriented Optimization Via Adaptive Thompson Sampling And Grid Refinement: A Tutorial With The ADAPTIVE\_TS Package
di: O'Gara, David, et al.
Pubblicazione: (2026)
di: O'Gara, David, et al.
Pubblicazione: (2026)
Start from the End: A Framework for Computational Policy Exploration to Inform Effective and Geospatially Consistent Interventions applied to COVID-19 in St. Louis
di: O'Gara, David, et al.
Pubblicazione: (2025)
di: O'Gara, David, et al.
Pubblicazione: (2025)
Social Media Bot Policies: Evaluating Passive and Active Enforcement
di: Radivojevic, Kristina, et al.
Pubblicazione: (2024)
di: Radivojevic, Kristina, et al.
Pubblicazione: (2024)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
di: Zhang, Borong, et al.
Pubblicazione: (2025)
di: Zhang, Borong, et al.
Pubblicazione: (2025)
SafeMT: Multi-turn Safety for Multimodal Language Models
di: Zhu, Han, et al.
Pubblicazione: (2025)
di: Zhu, Han, et al.
Pubblicazione: (2025)
Staying on Track: Efficient Trajectory Discovery with Adaptive Batch Sampling
di: Fadikar, Arindam, et al.
Pubblicazione: (2025)
di: Fadikar, Arindam, et al.
Pubblicazione: (2025)
Efficient Model-agnostic Alignment via Bayesian Persuasion
di: Bai, Fengshuo, et al.
Pubblicazione: (2024)
di: Bai, Fengshuo, et al.
Pubblicazione: (2024)
Policy Space Response Oracles: A Survey
di: Bighashdel, Ariyan, et al.
Pubblicazione: (2024)
di: Bighashdel, Ariyan, et al.
Pubblicazione: (2024)
Hardware-Enabled Mechanisms for Verifying Responsible AI Development
di: O'Gara, Aidan, et al.
Pubblicazione: (2025)
di: O'Gara, Aidan, et al.
Pubblicazione: (2025)
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs
di: Zhang, Guoxi, et al.
Pubblicazione: (2025)
di: Zhang, Guoxi, et al.
Pubblicazione: (2025)
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Aligner: Efficient Alignment by Learning to Correct
di: Ji, Jiaming, et al.
Pubblicazione: (2024) -
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024) -
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
di: Lou, Hantao, et al.
Pubblicazione: (2025) -
Plato's 'Republic'
di: McAleer, Sean
Pubblicazione: (2020) -
Mitigating Deceptive Alignment via Self-Monitoring
di: Ji, Jiaming, et al.
Pubblicazione: (2025)