Tutoring Large Language Models to be Domain-adaptive, Precise, and Safe
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Banerjee, Somnath |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems
par: Hazra, Rima, et autres
Publié: (2026)
par: Hazra, Rima, et autres
Publié: (2026)
SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models
par: Banerjee, Somnath, et autres
Publié: (2024)
par: Banerjee, Somnath, et autres
Publié: (2024)
AutoTutor meets Large Language Models: A Language Model Tutor with Rich Pedagogy and Guardrails
par: Chowdhury, Sankalan Pal, et autres
Publié: (2024)
par: Chowdhury, Sankalan Pal, et autres
Publié: (2024)
AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models
par: Adak, Sayantan, et autres
Publié: (2025)
par: Adak, Sayantan, et autres
Publié: (2025)
Sowing the Wind, Reaping the Whirlwind: The Impact of Editing Language Models
par: Hazra, Rima, et autres
Publié: (2024)
par: Hazra, Rima, et autres
Publié: (2024)
Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages
par: Banerjee, Somnath, et autres
Publié: (2026)
par: Banerjee, Somnath, et autres
Publié: (2026)
SafeMath: Inference-time Safety improves Math Accuracy
par: Basu, Sagnik, et autres
Publié: (2026)
par: Basu, Sagnik, et autres
Publié: (2026)
Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations
par: Hazra, Rima, et autres
Publié: (2024)
par: Hazra, Rima, et autres
Publié: (2024)
Language Models as Science Tutors
par: Chevalier, Alexis, et autres
Publié: (2024)
par: Chevalier, Alexis, et autres
Publié: (2024)
Empowering Private Tutoring by Chaining Large Language Models
par: Chen, Yulin, et autres
Publié: (2023)
par: Chen, Yulin, et autres
Publié: (2023)
Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations
par: Banerjee, Somnath, et autres
Publié: (2025)
par: Banerjee, Somnath, et autres
Publié: (2025)
AFRILANGTUTOR: Advancing Language Tutoring and Culture Education in Low-Resource Languages with Large Language Models
par: Belay, Tadesse Destaw, et autres
Publié: (2026)
par: Belay, Tadesse Destaw, et autres
Publié: (2026)
ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models
par: Banerjee, Somnath, et autres
Publié: (2025)
par: Banerjee, Somnath, et autres
Publié: (2025)
SafeLawBench: Towards Safe Alignment of Large Language Models
par: Cao, Chuxue, et autres
Publié: (2025)
par: Cao, Chuxue, et autres
Publié: (2025)
Can Large Language Models Match Tutoring System Adaptivity? A Benchmarking Study
par: Borchers, Conrad, et autres
Publié: (2025)
par: Borchers, Conrad, et autres
Publié: (2025)
PATS: Personality-Aware Teaching Strategies with Large Language Model Tutors
par: Rooein, Donya, et autres
Publié: (2026)
par: Rooein, Donya, et autres
Publié: (2026)
Exploring Applications of Transfer-State Large Language Models: Cognitive Profiling and Socratic AI Tutoring
par: Noguchi, Minori
Publié: (2026)
par: Noguchi, Minori
Publié: (2026)
Toward Automated Qualitative Analysis: Leveraging Large Language Models for Tutoring Dialogue Evaluation
par: Gu, Megan, et autres
Publié: (2025)
par: Gu, Megan, et autres
Publié: (2025)
Analyzing Sentiment Polarity Reduction in News Presentation through Contextual Perturbation and Large Language Models
par: Kuila, Alapan, et autres
Publié: (2024)
par: Kuila, Alapan, et autres
Publié: (2024)
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
par: Cui, Chenhang, et autres
Publié: (2024)
par: Cui, Chenhang, et autres
Publié: (2024)
Navigating the Cultural Kaleidoscope: A Hitchhiker's Guide to Sensitivity in Large Language Models
par: Banerjee, Somnath, et autres
Publié: (2024)
par: Banerjee, Somnath, et autres
Publié: (2024)
Large Language Models Approach Expert Pedagogical Quality in Math Tutoring but Differ in Instructional and Linguistic Profiles
par: Abdulsalam, Ramatu Oiza, et autres
Publié: (2025)
par: Abdulsalam, Ramatu Oiza, et autres
Publié: (2025)
Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment
par: Banerjee, Somnath, et autres
Publié: (2025)
par: Banerjee, Somnath, et autres
Publié: (2025)
Lost in Interpretation: The Plausibility-Faithfulness Trade-off in Cross-Lingual Explanations
par: Banerjee, Somnath, et autres
Publié: (2026)
par: Banerjee, Somnath, et autres
Publié: (2026)
Ruffle&Riley: Insights from Designing and Evaluating a Large Language Model-Based Conversational Tutoring System
par: Schmucker, Robin, et autres
Publié: (2024)
par: Schmucker, Robin, et autres
Publié: (2024)
Ensembling Large Language Models to Characterize Affective Dynamics in Student-AI Tutor Dialogues
par: Zhang, Chenyu, et autres
Publié: (2025)
par: Zhang, Chenyu, et autres
Publié: (2025)
Precise In-Parameter Concept Erasure in Large Language Models
par: Gur-Arieh, Yoav, et autres
Publié: (2025)
par: Gur-Arieh, Yoav, et autres
Publié: (2025)
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
par: Daheim, Nico, et autres
Publié: (2024)
par: Daheim, Nico, et autres
Publié: (2024)
Developing Safe and Responsible Large Language Model : Can We Balance Bias Reduction and Language Understanding in Large Language Models?
par: Raza, Shaina, et autres
Publié: (2024)
par: Raza, Shaina, et autres
Publié: (2024)
SafeLLM: Domain-Specific Safety Monitoring for Large Language Models: A Case Study of Offshore Wind Maintenance
par: Walker, Connor, et autres
Publié: (2024)
par: Walker, Connor, et autres
Publié: (2024)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
par: Zhang, Hengxiang, et autres
Publié: (2024)
par: Zhang, Hengxiang, et autres
Publié: (2024)
Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions
par: Zhang, Xiaoyun, et autres
Publié: (2024)
par: Zhang, Xiaoyun, et autres
Publié: (2024)
Artificial Intolerance: Stigmatizing Language in Clinical Documentation Skews Large Language Model Decision-Making
par: Huang, Jen-tse, et autres
Publié: (2026)
par: Huang, Jen-tse, et autres
Publié: (2026)
Exploring Safety-Utility Trade-Offs in Personalized Language Models
par: Vijjini, Anvesh Rao, et autres
Publié: (2024)
par: Vijjini, Anvesh Rao, et autres
Publié: (2024)
How (un)ethical are instruction-centric responses of LLMs? Unveiling the vulnerabilities of safety guardrails to harmful queries
par: Banerjee, Somnath, et autres
Publié: (2024)
par: Banerjee, Somnath, et autres
Publié: (2024)
SafeRoute: Adaptive Model Selection for Efficient and Accurate Safety Guardrails in Large Language Models
par: Lee, Seanie, et autres
Publié: (2025)
par: Lee, Seanie, et autres
Publié: (2025)
Precise Length Control in Large Language Models
par: Butcher, Bradley, et autres
Publié: (2024)
par: Butcher, Bradley, et autres
Publié: (2024)
Efficient Domain-adaptive Continual Pretraining for the Process Industry in the German Language
par: Zhukova, Anastasia, et autres
Publié: (2025)
par: Zhukova, Anastasia, et autres
Publié: (2025)
InfFeed: Influence Functions as a Feedback to Improve the Performance of Subjective Tasks
par: Banerjee, Somnath, et autres
Publié: (2024)
par: Banerjee, Somnath, et autres
Publié: (2024)
DistALANER: Distantly Supervised Active Learning Augmented Named Entity Recognition in the Open Source Software Ecosystem
par: Banerjee, Somnath, et autres
Publié: (2024)
par: Banerjee, Somnath, et autres
Publié: (2024)
Documents similaires
-
SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems
par: Hazra, Rima, et autres
Publié: (2026) -
SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models
par: Banerjee, Somnath, et autres
Publié: (2024) -
AutoTutor meets Large Language Models: A Language Model Tutor with Rich Pedagogy and Guardrails
par: Chowdhury, Sankalan Pal, et autres
Publié: (2024) -
AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models
par: Adak, Sayantan, et autres
Publié: (2025) -
Sowing the Wind, Reaping the Whirlwind: The Impact of Editing Language Models
par: Hazra, Rima, et autres
Publié: (2024)