Evaluating the role of `Constitutions' for learning from AI feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Redgate, Saskia, Bean, Andrew M., Mahdi, Adam |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation
par: Berlin, Konstantin, et autres
Publié: (2026)
par: Berlin, Konstantin, et autres
Publié: (2026)
C3AI: Crafting and Evaluating Constitutions for Constitutional AI
par: Kyrychenko, Yara, et autres
Publié: (2025)
par: Kyrychenko, Yara, et autres
Publié: (2025)
LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation
par: Khouja, Jude, et autres
Publié: (2025)
par: Khouja, Jude, et autres
Publié: (2025)
LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations
par: Mayne, Harry, et autres
Publié: (2025)
par: Mayne, Harry, et autres
Publié: (2025)
Inverse Constitutional AI: Compressing Preferences into Principles
par: Findeis, Arduin, et autres
Publié: (2024)
par: Findeis, Arduin, et autres
Publié: (2024)
Evaluating adaptive and generative AI-based feedback and recommendations in a knowledge-graph-integrated programming learning system
par: Nongkhai, Lalita Na, et autres
Publié: (2026)
par: Nongkhai, Lalita Na, et autres
Publié: (2026)
Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI
par: Maiya, Sharan, et autres
Publié: (2025)
par: Maiya, Sharan, et autres
Publié: (2025)
Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF
par: Fang, Yuan, et autres
Publié: (2026)
par: Fang, Yuan, et autres
Publié: (2026)
Clinical knowledge in LLMs does not translate to human interactions
par: Bean, Andrew M., et autres
Publié: (2025)
par: Bean, Andrew M., et autres
Publié: (2025)
Facts Fade Fast: Evaluating Memorization of Outdated Medical Knowledge in Large Language Models
par: Vladika, Juraj, et autres
Publié: (2025)
par: Vladika, Juraj, et autres
Publié: (2025)
How Well Do LLMs Understand Tunisian Arabic?
par: Mahdi, Mohamed
Publié: (2025)
par: Mahdi, Mohamed
Publié: (2025)
ConstitutionalExperts: Training a Mixture of Principle-based Prompts
par: Petridis, Savvas, et autres
Publié: (2024)
par: Petridis, Savvas, et autres
Publié: (2024)
Does Claude's Constitution Have a Culture?
par: Pourdavood, Parham
Publié: (2026)
par: Pourdavood, Parham
Publié: (2026)
Epistemic Constitutionalism Or: how to avoid coherence bias
par: Loi, Michele
Publié: (2026)
par: Loi, Michele
Publié: (2026)
Can sparse autoencoders be used to decompose and interpret steering vectors?
par: Mayne, Harry, et autres
Publié: (2024)
par: Mayne, Harry, et autres
Publié: (2024)
Optimizing Alignment with Less: Leveraging Data Augmentation for Personalized Evaluation
par: Seraj, Javad, et autres
Publié: (2024)
par: Seraj, Javad, et autres
Publié: (2024)
Humans can learn to detect AI-generated texts, or at least learn when they can't
par: Milička, Jiří, et autres
Publié: (2025)
par: Milička, Jiří, et autres
Publié: (2025)
Evaluating Fine-Tuning Efficiency of Human-Inspired Learning Strategies in Medical Question Answering
par: Yang, Yushi, et autres
Publié: (2024)
par: Yang, Yushi, et autres
Publié: (2024)
Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs
par: Alkaeed, Mahdi, et autres
Publié: (2026)
par: Alkaeed, Mahdi, et autres
Publié: (2026)
Reinforcement learning for question answering in programming domain using public community scoring as a human feedback
par: Gorbatovski, Alexey, et autres
Publié: (2024)
par: Gorbatovski, Alexey, et autres
Publié: (2024)
Language Alignment via Nash-learning and Adaptive feedback
par: Azarafrooz, Ari, et autres
Publié: (2024)
par: Azarafrooz, Ari, et autres
Publié: (2024)
PaperBench: Evaluating AI's Ability to Replicate AI Research
par: Starace, Giulio, et autres
Publié: (2025)
par: Starace, Giulio, et autres
Publié: (2025)
The Two Sides of the Coin: Hallucination Generation and Detection with LLMs as Evaluators for LLMs
par: Bui, Anh Thu Maria, et autres
Publié: (2024)
par: Bui, Anh Thu Maria, et autres
Publié: (2024)
JP-TL-Bench: Anchored Pairwise LLM Evaluation for Bidirectional Japanese-English Translation
par: Lin, Leonard, et autres
Publié: (2026)
par: Lin, Leonard, et autres
Publié: (2026)
Holistic Evaluation and Failure Diagnosis of AI Agents
par: Madvil, Netta, et autres
Publié: (2026)
par: Madvil, Netta, et autres
Publié: (2026)
Meta Prompting for AI Systems
par: Zhang, Yifan, et autres
Publié: (2023)
par: Zhang, Yifan, et autres
Publié: (2023)
When AI Does Science: Evaluating the Autonomous AI Scientist KOSMOS in Radiation Biology
par: Nusrat, Humza, et autres
Publié: (2025)
par: Nusrat, Humza, et autres
Publié: (2025)
Gender Encoding Patterns in Pretrained Language Model Representations
par: Zakizadeh, Mahdi, et autres
Publié: (2025)
par: Zakizadeh, Mahdi, et autres
Publié: (2025)
Blind Men and the Elephant: Diverse Perspectives on Gender Stereotypes in Benchmark Datasets
par: Zakizadeh, Mahdi, et autres
Publié: (2025)
par: Zakizadeh, Mahdi, et autres
Publié: (2025)
AI-Assisted Systematization for Evaluating GenAI Systems
par: Agarwal, Dhruv, et autres
Publié: (2026)
par: Agarwal, Dhruv, et autres
Publié: (2026)
Evaluating LLM Reasoning in the Operations Research Domain with ORQA
par: Mostajabdaveh, Mahdi, et autres
Publié: (2024)
par: Mostajabdaveh, Mahdi, et autres
Publié: (2024)
Evaluating GPT-3.5's Awareness and Summarization Abilities for European Constitutional Texts with Shared Topics
par: Greco, Candida M., et autres
Publié: (2024)
par: Greco, Candida M., et autres
Publié: (2024)
PerQ: Efficient Evaluation of Multilingual Text Personalization Quality
par: Macko, Dominik, et autres
Publié: (2025)
par: Macko, Dominik, et autres
Publié: (2025)
Towards stable AI systems for Evaluating Arabic Pronunciations
par: Zaatiti, Hadi, et autres
Publié: (2025)
par: Zaatiti, Hadi, et autres
Publié: (2025)
On the Importance and Evaluation of Narrativity in Natural Language AI Explanations
par: Cedro, Mateusz, et autres
Publié: (2026)
par: Cedro, Mateusz, et autres
Publié: (2026)
ReviewEval: An Evaluation Framework for AI-Generated Reviews
par: Garg, Madhav Krishan, et autres
Publié: (2025)
par: Garg, Madhav Krishan, et autres
Publié: (2025)
The Science of Evaluating Foundation Models
par: Yuan, Jiayi, et autres
Publié: (2025)
par: Yuan, Jiayi, et autres
Publié: (2025)
MegaChat: A Synthetic Persian Q&A Dataset for High-Quality Sales Chatbot Evaluation
par: Rahmani, Mahdi, et autres
Publié: (2025)
par: Rahmani, Mahdi, et autres
Publié: (2025)
LLM Prompt Evaluation for Educational Applications
par: Holmes, Langdon, et autres
Publié: (2026)
par: Holmes, Langdon, et autres
Publié: (2026)
SCENE: Evaluating Explainable AI Techniques Using Soft Counterfactuals
par: Zheng, Haoran, et autres
Publié: (2024)
par: Zheng, Haoran, et autres
Publié: (2024)
Documents similaires
-
Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation
par: Berlin, Konstantin, et autres
Publié: (2026) -
C3AI: Crafting and Evaluating Constitutions for Constitutional AI
par: Kyrychenko, Yara, et autres
Publié: (2025) -
LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation
par: Khouja, Jude, et autres
Publié: (2025) -
LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations
par: Mayne, Harry, et autres
Publié: (2025) -
Inverse Constitutional AI: Compressing Preferences into Principles
par: Findeis, Arduin, et autres
Publié: (2024)