MANTA: Multi-turn Assessment for Nonhuman Thinking & Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Allen, Luong, Isabella, Chen, Joyee |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Alignment as Jurisprudence
di: Caputo, Nicholas
Pubblicazione: (2026)
di: Caputo, Nicholas
Pubblicazione: (2026)
Position: Model Collapse Does Not Mean What You Think
di: Schaeffer, Rylan, et al.
Pubblicazione: (2025)
di: Schaeffer, Rylan, et al.
Pubblicazione: (2025)
Pluralistic Alignment Over Time
di: Klassen, Toryn Q., et al.
Pubblicazione: (2024)
di: Klassen, Toryn Q., et al.
Pubblicazione: (2024)
Moral Alignment for LLM Agents
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024)
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024)
AI Alignment at Your Discretion
di: Buyl, Maarten, et al.
Pubblicazione: (2025)
di: Buyl, Maarten, et al.
Pubblicazione: (2025)
LLM Safety Alignment is Divergence Estimation in Disguise
di: Haldar, Rajdeep, et al.
Pubblicazione: (2025)
di: Haldar, Rajdeep, et al.
Pubblicazione: (2025)
Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research
di: Cooper, A. Feder, et al.
Pubblicazione: (2024)
di: Cooper, A. Feder, et al.
Pubblicazione: (2024)
TestAgent: An Adaptive and Intelligent Expert for Human Assessment
di: Yu, Junhao, et al.
Pubblicazione: (2025)
di: Yu, Junhao, et al.
Pubblicazione: (2025)
Being Considerate as a Pathway Towards Pluralistic Alignment for Agentic AI
di: Alamdari, Parand A., et al.
Pubblicazione: (2024)
di: Alamdari, Parand A., et al.
Pubblicazione: (2024)
Decolonial AI Alignment: Openness, Viśe\d{s}a-Dharma, and Including Excluded Knowledges
di: Varshney, Kush R.
Pubblicazione: (2023)
di: Varshney, Kush R.
Pubblicazione: (2023)
The Alignment Trap: Complexity Barriers
di: Yao, Jasper
Pubblicazione: (2025)
di: Yao, Jasper
Pubblicazione: (2025)
Assessing Social Alignment: Do Personality-Prompted Large Language Models Behave Like Humans?
di: Zakazov, Ivan, et al.
Pubblicazione: (2024)
di: Zakazov, Ivan, et al.
Pubblicazione: (2024)
Generative Artificial Intelligence in Healthcare: Ethical Considerations and Assessment Checklist
di: Ning, Yilin, et al.
Pubblicazione: (2023)
di: Ning, Yilin, et al.
Pubblicazione: (2023)
New-Onset Diabetes Assessment Using Artificial Intelligence-Enhanced Electrocardiography
di: Zhang, Hao, et al.
Pubblicazione: (2022)
di: Zhang, Hao, et al.
Pubblicazione: (2022)
Participatory Assessment of Large Language Model Applications in an Academic Medical Center
di: Carra, Giorgia, et al.
Pubblicazione: (2024)
di: Carra, Giorgia, et al.
Pubblicazione: (2024)
Multimodal Assessment of Classroom Discourse Quality: A Text-Centered Attention-Based Multi-Task Learning Approach
di: Hou, Ruikun, et al.
Pubblicazione: (2025)
di: Hou, Ruikun, et al.
Pubblicazione: (2025)
ThinkTank-ME: A Multi-Expert Framework for Middle East Event Forecasting
di: Li, Haoxuan, et al.
Pubblicazione: (2026)
di: Li, Haoxuan, et al.
Pubblicazione: (2026)
Surveying Attitudinal Alignment Between Large Language Models Vs. Humans Towards 17 Sustainable Development Goals
di: Wu, Qingyang, et al.
Pubblicazione: (2024)
di: Wu, Qingyang, et al.
Pubblicazione: (2024)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
di: Anwar, Usman, et al.
Pubblicazione: (2024)
di: Anwar, Usman, et al.
Pubblicazione: (2024)
Implementation of Big Data Analytics for Diabetes Management: Needs Assessment in the Rwanda Healthcare System
di: Majyambere, Silas, et al.
Pubblicazione: (2026)
di: Majyambere, Silas, et al.
Pubblicazione: (2026)
Deliberative Alignment: Reasoning Enables Safer Language Models
di: Guan, Melody Y., et al.
Pubblicazione: (2024)
di: Guan, Melody Y., et al.
Pubblicazione: (2024)
AI and Generative AI Transforming Disaster Management: A Survey of Damage Assessment and Response Techniques
di: Raj, Aman, et al.
Pubblicazione: (2025)
di: Raj, Aman, et al.
Pubblicazione: (2025)
EigenBench: A Comparative Behavioral Measure of Value Alignment
di: Chang, Jonathn, et al.
Pubblicazione: (2025)
di: Chang, Jonathn, et al.
Pubblicazione: (2025)
Pain Intensity Assessment in Sickle Cell Disease patients using Vital Signs during Hospital Visits
di: Padhee, Swati, et al.
Pubblicazione: (2020)
di: Padhee, Swati, et al.
Pubblicazione: (2020)
Thinking Outside the (Gray) Box: A Context-Based Score for Assessing Value and Originality in Neural Text Generation
di: Franceschelli, Giorgio, et al.
Pubblicazione: (2025)
di: Franceschelli, Giorgio, et al.
Pubblicazione: (2025)
MAP: Multi-Human-Value Alignment Palette
di: Wang, Xinran, et al.
Pubblicazione: (2024)
di: Wang, Xinran, et al.
Pubblicazione: (2024)
Does Cross-Cultural Alignment Change the Commonsense Morality of Language Models?
di: Jinnai, Yuu
Pubblicazione: (2024)
di: Jinnai, Yuu
Pubblicazione: (2024)
Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse
di: Liu, Ryan, et al.
Pubblicazione: (2024)
di: Liu, Ryan, et al.
Pubblicazione: (2024)
Unlocking Insights Addressing Alcohol Inference Mismatch through Database-Narrative Alignment
di: Bhagat, Sudesh, et al.
Pubblicazione: (2025)
di: Bhagat, Sudesh, et al.
Pubblicazione: (2025)
See, Think, Act: Online Shopper Behavior Simulation with VLM Agents
di: Zhang, Yimeng, et al.
Pubblicazione: (2025)
di: Zhang, Yimeng, et al.
Pubblicazione: (2025)
When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
Partial Identification Approach to Counterfactual Fairness Assessment
di: Rho, Saeyoung, et al.
Pubblicazione: (2025)
di: Rho, Saeyoung, et al.
Pubblicazione: (2025)
Global Rewards in Restless Multi-Armed Bandits
di: Raman, Naveen, et al.
Pubblicazione: (2024)
di: Raman, Naveen, et al.
Pubblicazione: (2024)
Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook
di: Lee, Jaehyeok, et al.
Pubblicazione: (2026)
di: Lee, Jaehyeok, et al.
Pubblicazione: (2026)
FairMT: Fairness for Heterogeneous Multi-Task Learning
di: Hu, Guanyu, et al.
Pubblicazione: (2025)
di: Hu, Guanyu, et al.
Pubblicazione: (2025)
Multi-Output Distributional Fairness via Post-Processing
di: Li, Gang, et al.
Pubblicazione: (2024)
di: Li, Gang, et al.
Pubblicazione: (2024)
ICE-T: A Multi-Faceted Concept for Teaching Machine Learning
di: Krone, Hendrik, et al.
Pubblicazione: (2024)
di: Krone, Hendrik, et al.
Pubblicazione: (2024)
A Survey on Multi-Resident Activity Recognition in Smart Environments
di: Shiri, Farhad MortezaPour, et al.
Pubblicazione: (2023)
di: Shiri, Farhad MortezaPour, et al.
Pubblicazione: (2023)
Improving Academic Skills Assessment with NLP and Ensemble Learning
di: Huang, Xinyi, et al.
Pubblicazione: (2024)
di: Huang, Xinyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Alignment as Jurisprudence
di: Caputo, Nicholas
Pubblicazione: (2026) -
Position: Model Collapse Does Not Mean What You Think
di: Schaeffer, Rylan, et al.
Pubblicazione: (2025) -
Pluralistic Alignment Over Time
di: Klassen, Toryn Q., et al.
Pubblicazione: (2024) -
Moral Alignment for LLM Agents
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024) -
AI Alignment at Your Discretion
di: Buyl, Maarten, et al.
Pubblicazione: (2025)