SPRI: Aligning Large Language Models with Context-Situated Principles
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhan, Hongli, Azmat, Muneeza, Horesh, Raya, Li, Junyi Jessy, Yurochkin, Mikhail |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Speculate, then Collaborate: Fusing Knowledge of Language Models during Decoding
por: Wang, Ziyao, et al.
Publicado: (2025)
por: Wang, Ziyao, et al.
Publicado: (2025)
Out-of-Distribution Detection using Synthetic Data Generation
por: Abbas, Momin, et al.
Publicado: (2025)
por: Abbas, Momin, et al.
Publicado: (2025)
Large Language Models Produce Responses Perceived to be Empathic
por: Lee, Yoon Kyung, et al.
Publicado: (2024)
por: Lee, Yoon Kyung, et al.
Publicado: (2024)
Discourse Diversity in Multi-Turn Empathic Dialogue
por: Zhan, Hongli, et al.
Publicado: (2026)
por: Zhan, Hongli, et al.
Publicado: (2026)
Exploring Human Perceptions of AI Responses: Insights from a Mixed-Methods Study on Risk Mitigation in Generative Models
por: Candello, Heloisa, et al.
Publicado: (2025)
por: Candello, Heloisa, et al.
Publicado: (2025)
CharED: Character-wise Ensemble Decoding for Large Language Models
por: Gu, Kevin, et al.
Publicado: (2024)
por: Gu, Kevin, et al.
Publicado: (2024)
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
por: Huang, Yukun, et al.
Publicado: (2024)
por: Huang, Yukun, et al.
Publicado: (2024)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
por: Sun, Xiongtao, et al.
Publicado: (2024)
por: Sun, Xiongtao, et al.
Publicado: (2024)
Aligning VLM Assistants with Personalized Situated Cognition
por: Li, Yongqi, et al.
Publicado: (2025)
por: Li, Yongqi, et al.
Publicado: (2025)
Aligning Large Language Models from Self-Reference AI Feedback with one General Principle
por: Bao, Rong, et al.
Publicado: (2024)
por: Bao, Rong, et al.
Publicado: (2024)
LLMs Lean on Priors, Not Programming Language Semantics
por: Thimmaiah, Aditya, et al.
Publicado: (2025)
por: Thimmaiah, Aditya, et al.
Publicado: (2025)
A Comprehensive Evaluation framework of Alignment Techniques for LLMs
por: Azmat, Muneeza, et al.
Publicado: (2025)
por: Azmat, Muneeza, et al.
Publicado: (2025)
Robo-Instruct: Simulator-Augmented Instruction Alignment For Finetuning Code LLMs
por: Hu, Zichao, et al.
Publicado: (2024)
por: Hu, Zichao, et al.
Publicado: (2024)
Context-DPO: Aligning Language Models for Context-Faithfulness
por: Bi, Baolong, et al.
Publicado: (2024)
por: Bi, Baolong, et al.
Publicado: (2024)
CultureBank: An Online Community-Driven Knowledge Base Towards Culturally Aware Language Technologies
por: Shi, Weiyan, et al.
Publicado: (2024)
por: Shi, Weiyan, et al.
Publicado: (2024)
FastMem: Fast Memorization of Prompt Improves Context Awareness of Large Language Models
por: Zhu, Junyi, et al.
Publicado: (2024)
por: Zhu, Junyi, et al.
Publicado: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
por: Zhou, Guanghao, et al.
Publicado: (2025)
por: Zhou, Guanghao, et al.
Publicado: (2025)
CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models
por: Sun, Guangzhi, et al.
Publicado: (2025)
por: Sun, Guangzhi, et al.
Publicado: (2025)
Just Go Parallel: Improving the Multilingual Capabilities of Large Language Models
por: Qorib, Muhammad Reza, et al.
Publicado: (2025)
por: Qorib, Muhammad Reza, et al.
Publicado: (2025)
Attention-Aligned Reasoning for Large Language Models
por: Zhang, Hongxiang, et al.
Publicado: (2025)
por: Zhang, Hongxiang, et al.
Publicado: (2025)
Aligning Large Language Models with Counterfactual DPO
por: Butcher, Bradley
Publicado: (2024)
por: Butcher, Bradley
Publicado: (2024)
Aligning Large Language Models with Searcher Preferences
por: Wu, Wei, et al.
Publicado: (2026)
por: Wu, Wei, et al.
Publicado: (2026)
Large Language Models are In-Context Molecule Learners
por: Li, Jiatong, et al.
Publicado: (2024)
por: Li, Jiatong, et al.
Publicado: (2024)
Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models
por: Cho, Seong Hah, et al.
Publicado: (2026)
por: Cho, Seong Hah, et al.
Publicado: (2026)
Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models
por: Chepurova, Alla, et al.
Publicado: (2025)
por: Chepurova, Alla, et al.
Publicado: (2025)
Large Language Models are Capable of Offering Cognitive Reappraisal, if Guided
por: Zhan, Hongli, et al.
Publicado: (2024)
por: Zhan, Hongli, et al.
Publicado: (2024)
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023)
por: Ma, Ziqiao, et al.
Publicado: (2023)
Electronic Circuit Principles of Large Language Models
por: Chen, Qiguang, et al.
Publicado: (2025)
por: Chen, Qiguang, et al.
Publicado: (2025)
MMRAG: Multi-Mode Retrieval-Augmented Generation with Large Language Models for Biomedical In-Context Learning
por: Zhan, Zaifu, et al.
Publicado: (2025)
por: Zhan, Zaifu, et al.
Publicado: (2025)
Task-Aligned Tool Recommendation for Large Language Models
por: Gao, Hang, et al.
Publicado: (2024)
por: Gao, Hang, et al.
Publicado: (2024)
Is It JUST Semantics? A Case Study of Discourse Particle Understanding in LLMs
por: Sheffield, William, et al.
Publicado: (2025)
por: Sheffield, William, et al.
Publicado: (2025)
Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
por: Li, Junyi, et al.
Publicado: (2025)
por: Li, Junyi, et al.
Publicado: (2025)
GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding
por: Zhang, Ziyin, et al.
Publicado: (2024)
por: Zhang, Ziyin, et al.
Publicado: (2024)
Semantic Representation Attack against Aligned Large Language Models
por: Lian, Jiawei, et al.
Publicado: (2025)
por: Lian, Jiawei, et al.
Publicado: (2025)
Empathy by Design: Aligning Large Language Models for Healthcare Dialogue
por: Umucu, Emre, et al.
Publicado: (2025)
por: Umucu, Emre, et al.
Publicado: (2025)
Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models
por: Lian, Jiawei, et al.
Publicado: (2025)
por: Lian, Jiawei, et al.
Publicado: (2025)
Aligning Large Language Model Behavior with Human Citation Preferences
por: Ando, Kenichiro, et al.
Publicado: (2026)
por: Ando, Kenichiro, et al.
Publicado: (2026)
Align to Structure: Aligning Large Language Models with Structural Information
por: Kim, Zae Myung, et al.
Publicado: (2025)
por: Kim, Zae Myung, et al.
Publicado: (2025)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
por: Li, Junsong, et al.
Publicado: (2025)
por: Li, Junsong, et al.
Publicado: (2025)
Do Large Language Models Align with Core Mental Health Counseling Competencies?
por: Nguyen, Viet Cuong, et al.
Publicado: (2024)
por: Nguyen, Viet Cuong, et al.
Publicado: (2024)
Ejemplares similares
-
Speculate, then Collaborate: Fusing Knowledge of Language Models during Decoding
por: Wang, Ziyao, et al.
Publicado: (2025) -
Out-of-Distribution Detection using Synthetic Data Generation
por: Abbas, Momin, et al.
Publicado: (2025) -
Large Language Models Produce Responses Perceived to be Empathic
por: Lee, Yoon Kyung, et al.
Publicado: (2024) -
Discourse Diversity in Multi-Turn Empathic Dialogue
por: Zhan, Hongli, et al.
Publicado: (2026) -
Exploring Human Perceptions of AI Responses: Insights from a Mixed-Methods Study on Risk Mitigation in Generative Models
por: Candello, Heloisa, et al.
Publicado: (2025)