Alignment Studio: Aligning Large Language Models to Particular Contextual Regulations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Achintalwar, Swapnaja, Baldini, Ioana, Bouneffouf, Djallel, Byamugisha, Joan, Chang, Maria, Dognin, Pierre, Farchi, Eitan, Makondo, Ndivhuwo, Mojsilovic, Aleksandra, Nagireddy, Manish, Ramamurthy, Karthikeyan Natesan, Padhi, Inkit, Raz, Orna, Rios, Jesus, Sattigeri, Prasanna, Singh, Moninder, Thwala, Siphiwe, Uceda-Sosa, Rosario A., Varshney, Kush R. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Value Alignment from Unstructured Text
par: Padhi, Inkit, et autres
Publié: (2024)
par: Padhi, Inkit, et autres
Publié: (2024)
Contextual Moral Value Alignment Through Context-Based Aggregation
par: Dognin, Pierre, et autres
Publié: (2024)
par: Dognin, Pierre, et autres
Publié: (2024)
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024)
par: Lee, Bruce W., et autres
Publié: (2024)
When in Doubt, Cascade: Towards Building Efficient and Capable Guardrails
par: Nagireddy, Manish, et autres
Publié: (2024)
par: Nagireddy, Manish, et autres
Publié: (2024)
Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs
par: Gourabathina, Abinitha, et autres
Publié: (2026)
par: Gourabathina, Abinitha, et autres
Publié: (2026)
Reasoning about concepts with LLMs: Inconsistencies abound
par: Uceda-Sosa, Rosario, et autres
Publié: (2024)
par: Uceda-Sosa, Rosario, et autres
Publié: (2024)
Evaluating the Prompt Steerability of Large Language Models
par: Miehling, Erik, et autres
Publié: (2024)
par: Miehling, Erik, et autres
Publié: (2024)
The Ultimate Test of Superintelligent AI Agents: Can an AI Balance Care and Control in Asymmetric Relationships?
par: Bouneffouf, Djallel, et autres
Publié: (2025)
par: Bouneffouf, Djallel, et autres
Publié: (2025)
Final-Model-Only Data Attribution with a Unifying View of Gradient-Based Methods
par: Wei, Dennis, et autres
Publié: (2024)
par: Wei, Dennis, et autres
Publié: (2024)
Survey: Multi-Armed Bandits Meet Large Language Models
par: Bouneffouf, Djallel, et autres
Publié: (2025)
par: Bouneffouf, Djallel, et autres
Publié: (2025)
Detectors for Safe and Reliable LLMs: Implementations, Uses, and Limitations
par: Achintalwar, Swapnaja, et autres
Publié: (2024)
par: Achintalwar, Swapnaja, et autres
Publié: (2024)
Ranking Large Language Models without Ground Truth
par: Dhurandhar, Amit, et autres
Publié: (2024)
par: Dhurandhar, Amit, et autres
Publié: (2024)
Statistical multi-metric evaluation and visualization of LLM system predictive performance
par: Ackerman, Samuel, et autres
Publié: (2025)
par: Ackerman, Samuel, et autres
Publié: (2025)
Automatic Generation of Benchmarks and Reliable LLM Judgment for Code Tasks
par: Farchi, Eitan, et autres
Publié: (2024)
par: Farchi, Eitan, et autres
Publié: (2024)
Generating Unseen Code Tests In Infinitum
par: Zalmanovici, Marcel, et autres
Publié: (2024)
par: Zalmanovici, Marcel, et autres
Publié: (2024)
Using Combinatorial Optimization to Design a High quality LLM Solution
par: Ackerman, Samuel, et autres
Publié: (2024)
par: Ackerman, Samuel, et autres
Publié: (2024)
Agentic AI Needs a Systems Theory
par: Miehling, Erik, et autres
Publié: (2025)
par: Miehling, Erik, et autres
Publié: (2025)
Mitigating Misalignment Contagion by Steering with Implicit Traits
par: Chang, Maria, et autres
Publié: (2026)
par: Chang, Maria, et autres
Publié: (2026)
Assessing AI Utility: The Random Guesser Test for Sequential Decision-Making Systems
par: Ide, Shun, et autres
Publié: (2024)
par: Ide, Shun, et autres
Publié: (2024)
Conversational Topic Recommendation in Counseling and Psychotherapy with Decision Transformer and Large Language Models
par: Gunal, Aylin, et autres
Publié: (2024)
par: Gunal, Aylin, et autres
Publié: (2024)
Scopes of Alignment
par: Varshney, Kush R., et autres
Publié: (2025)
par: Varshney, Kush R., et autres
Publié: (2025)
AI Steerability 360: A Toolkit for Steering Large Language Models
par: Miehling, Erik, et autres
Publié: (2026)
par: Miehling, Erik, et autres
Publié: (2026)
Enhancing Value Alignment of LLMs with Multi-agent system and Combinatorial Fusion
par: Wu, Yuanhong, et autres
Publié: (2026)
par: Wu, Yuanhong, et autres
Publié: (2026)
LCGuard: Latent Communication Guard for Safe KV Sharing in Multi-Agent Systems
par: Asif, Sadia, et autres
Publié: (2026)
par: Asif, Sadia, et autres
Publié: (2026)
Cross-Examiner: Evaluating Consistency of Large Language Model-Generated Explanations
par: Villa, Danielle, et autres
Publié: (2025)
par: Villa, Danielle, et autres
Publié: (2025)
Targeted Advertising on Social Networks Using Online Variational Tensor Regression
par: Idé, Tsuyoshi, et autres
Publié: (2022)
par: Idé, Tsuyoshi, et autres
Publié: (2022)
Auditing and Generating Synthetic Data with Controllable Trust Trade-offs
par: Belgodere, Brian, et autres
Publié: (2023)
par: Belgodere, Brian, et autres
Publié: (2023)
How Safe is Your Safety Metric? Automatic Concatenation Tests for Metric Reliability
par: Fandina, Ora Nova, et autres
Publié: (2024)
par: Fandina, Ora Nova, et autres
Publié: (2024)
WikiContradict: A Benchmark for Evaluating LLMs on Real-World Knowledge Conflicts from Wikipedia
par: Hou, Yufang, et autres
Publié: (2024)
par: Hou, Yufang, et autres
Publié: (2024)
Impact of Workplace Dental Wellness Programmes on Self-reported Oral Health Behaviors and Conditions in Urban South Africa
par: Makhene, Siphiwe
Publié: (2012)
par: Makhene, Siphiwe
Publié: (2012)
Multi-Level Explanations for Generative Language Models
par: Paes, Lucas Monteiro, et autres
Publié: (2024)
par: Paes, Lucas Monteiro, et autres
Publié: (2024)
Image Captioning as an Assistive Technology: Lessons Learned from VizWiz 2020 Challenge
par: Dognin, Pierre, et autres
Publié: (2020)
par: Dognin, Pierre, et autres
Publié: (2020)
The Effectiveness of Approximate Regularized Replay for Efficient Supervised Fine-Tuning of Large Language Models
par: Riemer, Matthew, et autres
Publié: (2025)
par: Riemer, Matthew, et autres
Publié: (2025)
Interpolating Item and User Fairness in Multi-Sided Recommendations
par: Chen, Qinyi, et autres
Publié: (2023)
par: Chen, Qinyi, et autres
Publié: (2023)
Automated Validation of LLM-based Evaluators for Software Engineering Artifacts
par: Fandina, Ora Nova, et autres
Publié: (2025)
par: Fandina, Ora Nova, et autres
Publié: (2025)
Few-shot Policy (de)composition in Conversational Question Answering
par: Erwin, Kyle, et autres
Publié: (2025)
par: Erwin, Kyle, et autres
Publié: (2025)
Building a Foundational Guardrail for General Agentic Systems via Synthetic Data
par: Huang, Yue, et autres
Publié: (2025)
par: Huang, Yue, et autres
Publié: (2025)
Sparsity May Be All You Need: Sparse Random Parameter Adaptation
par: Rios, Jesus, et autres
Publié: (2025)
par: Rios, Jesus, et autres
Publié: (2025)
Uncovering Code Insights: Leveraging GitHub Artifacts for Deeper Code Understanding
par: Nevo, Ziv, et autres
Publié: (2025)
par: Nevo, Ziv, et autres
Publié: (2025)
Granite Guardian
par: Padhi, Inkit, et autres
Publié: (2024)
par: Padhi, Inkit, et autres
Publié: (2024)
Documents similaires
-
Value Alignment from Unstructured Text
par: Padhi, Inkit, et autres
Publié: (2024) -
Contextual Moral Value Alignment Through Context-Based Aggregation
par: Dognin, Pierre, et autres
Publié: (2024) -
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024) -
When in Doubt, Cascade: Towards Building Efficient and Capable Guardrails
par: Nagireddy, Manish, et autres
Publié: (2024) -
Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs
par: Gourabathina, Abinitha, et autres
Publié: (2026)