Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Chenchen, Zhang, Zheyu, Kasneci, Gjergji |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models
di: Yuan, Chenchen, et al.
Pubblicazione: (2025)
di: Yuan, Chenchen, et al.
Pubblicazione: (2025)
Active Tabular Augmentation via Policy-Guided Diffusion Inpainting
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
Doubling Your Data in Minutes: Ultra-fast Tabular Data Generation via LLM-Induced Dependency Graphs
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
Enriching Tabular Data with Contextual LLM Embeddings: A Comprehensive Ablation Study for Ensemble Classifiers
di: Kasneci, Gjergji, et al.
Pubblicazione: (2024)
di: Kasneci, Gjergji, et al.
Pubblicazione: (2024)
Position: Uncertainty Quantification Needs Reassessment for Large-language Model Agents
di: Kirchhof, Michael, et al.
Pubblicazione: (2025)
di: Kirchhof, Michael, et al.
Pubblicazione: (2025)
Emergent Abilities in Large Language Models: A Survey
di: Berti, Leonardo, et al.
Pubblicazione: (2025)
di: Berti, Leonardo, et al.
Pubblicazione: (2025)
Moral Lenses, Political Coordinates: Towards Ideological Positioning of Morally Conditioned LLMs
di: Yuan, Chenchen, et al.
Pubblicazione: (2026)
di: Yuan, Chenchen, et al.
Pubblicazione: (2026)
CURE: Controlled Unlearning for Robust Embeddings -- Mitigating Conceptual Shortcuts in Pre-Trained Language Models
di: Kocak, Aysenur, et al.
Pubblicazione: (2025)
di: Kocak, Aysenur, et al.
Pubblicazione: (2025)
TLOB: A Novel Transformer Model with Dual Attention for Price Trend Prediction with Limit Order Book Data
di: Berti, Leonardo, et al.
Pubblicazione: (2025)
di: Berti, Leonardo, et al.
Pubblicazione: (2025)
Attention Mechanisms Don't Learn Additive Models: Rethinking Feature Importance for Transformers
di: Leemann, Tobias, et al.
Pubblicazione: (2024)
di: Leemann, Tobias, et al.
Pubblicazione: (2024)
I Prefer not to Say: Protecting User Consent in Models with Optional Personal Data
di: Leemann, Tobias, et al.
Pubblicazione: (2022)
di: Leemann, Tobias, et al.
Pubblicazione: (2022)
EvalxNLP: A Framework for Benchmarking Post-Hoc Explainability Methods on NLP Models
di: Dhaini, Mahdi, et al.
Pubblicazione: (2025)
di: Dhaini, Mahdi, et al.
Pubblicazione: (2025)
P-TA: Using Proximal Policy Optimization to Enhance Tabular Data Augmentation via Large Language Models
di: Yang, Shuo, et al.
Pubblicazione: (2024)
di: Yang, Shuo, et al.
Pubblicazione: (2024)
Gender Bias in Explainability: Investigating Performance Disparity in Post-hoc Methods
di: Dhaini, Mahdi, et al.
Pubblicazione: (2025)
di: Dhaini, Mahdi, et al.
Pubblicazione: (2025)
Consolidating Rewarded Perturbations for LLM Post-Training
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
Not All Features Deserve Attention: Graph-Guided Dependency Learning for Tabular Data Generation with Language Models
di: Zhang, Zheyu, et al.
Pubblicazione: (2025)
di: Zhang, Zheyu, et al.
Pubblicazione: (2025)
Grokking in the Wild: Data Augmentation for Real-World Multi-Hop Reasoning with Transformers
di: Abramov, Roman, et al.
Pubblicazione: (2025)
di: Abramov, Roman, et al.
Pubblicazione: (2025)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
di: Zhao, Zilong, et al.
Pubblicazione: (2024)
di: Zhao, Zilong, et al.
Pubblicazione: (2024)
SAGE: Sparse Adaptive Guidance for Dependency-Aware Tabular Data Generation
di: Yang, Shuo, et al.
Pubblicazione: (2026)
di: Yang, Shuo, et al.
Pubblicazione: (2026)
Is Crowdsourcing Breaking Your Bank? Cost-Effective Fine-Tuning of Pre-trained Language Models with Proximal Policy Optimization
di: Yang, Shuo, et al.
Pubblicazione: (2024)
di: Yang, Shuo, et al.
Pubblicazione: (2024)
Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks
di: Kasneci, Enkelejda, et al.
Pubblicazione: (2026)
di: Kasneci, Enkelejda, et al.
Pubblicazione: (2026)
Assessing the Real-World Utility of Explainable AI for Arousal Diagnostics: An Application-Grounded User Study
di: Kraft, Stefan, et al.
Pubblicazione: (2025)
di: Kraft, Stefan, et al.
Pubblicazione: (2025)
Confidence Calibration in Large Language Models
di: Michael, Noam, et al.
Pubblicazione: (2026)
di: Michael, Noam, et al.
Pubblicazione: (2026)
Saliency-Aware Regularized Quantization Calibration for Large Language Models
di: Zhao, Yanlong, et al.
Pubblicazione: (2026)
di: Zhao, Yanlong, et al.
Pubblicazione: (2026)
Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models
di: Sui, Yuan, et al.
Pubblicazione: (2025)
di: Sui, Yuan, et al.
Pubblicazione: (2025)
FL-NAS: Towards Fairness of NAS for Resource Constrained Devices via Large Language Models
di: Qin, Ruiyang, et al.
Pubblicazione: (2024)
di: Qin, Ruiyang, et al.
Pubblicazione: (2024)
Restoring Calibration for Aligned Large Language Models: A Calibration-Aware Fine-Tuning Approach
di: Xiao, Jiancong, et al.
Pubblicazione: (2025)
di: Xiao, Jiancong, et al.
Pubblicazione: (2025)
Automatic Calibration for Membership Inference Attack on Large Language Models
di: Zade, Saleh Zare, et al.
Pubblicazione: (2025)
di: Zade, Saleh Zare, et al.
Pubblicazione: (2025)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
di: Yu, Zhouliang, et al.
Pubblicazione: (2025)
From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty
di: Jenane, Azza, et al.
Pubblicazione: (2026)
di: Jenane, Azza, et al.
Pubblicazione: (2026)
Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation
di: Wang, Xinyi, et al.
Pubblicazione: (2024)
di: Wang, Xinyi, et al.
Pubblicazione: (2024)
Where Do Reasoning Models Refuse?
di: Yamaguchi, Kureha, et al.
Pubblicazione: (2025)
di: Yamaguchi, Kureha, et al.
Pubblicazione: (2025)
MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models
di: Wang, Jason Z
Pubblicazione: (2026)
di: Wang, Jason Z
Pubblicazione: (2026)
Inducing Human-like Biases in Moral Reasoning Language Models
di: Karpov, Artem, et al.
Pubblicazione: (2024)
di: Karpov, Artem, et al.
Pubblicazione: (2024)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
di: Shen, Wei, et al.
Pubblicazione: (2025)
di: Shen, Wei, et al.
Pubblicazione: (2025)
Modular Machine Learning: An Indispensable Path towards New-Generation Large Language Models
di: Wang, Xin, et al.
Pubblicazione: (2025)
di: Wang, Xin, et al.
Pubblicazione: (2025)
Beware of Calibration Data for Pruning Large Language Models
di: Ji, Yixin, et al.
Pubblicazione: (2024)
di: Ji, Yixin, et al.
Pubblicazione: (2024)
Reasoning-Enhanced Large Language Models for Molecular Property Prediction
di: Zhuang, Jiaxi, et al.
Pubblicazione: (2025)
di: Zhuang, Jiaxi, et al.
Pubblicazione: (2025)
Are Large-Language Models Graph Algorithmic Reasoners?
di: Taylor, Alexander K, et al.
Pubblicazione: (2024)
di: Taylor, Alexander K, et al.
Pubblicazione: (2024)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models
di: Yuan, Chenchen, et al.
Pubblicazione: (2025) -
Active Tabular Augmentation via Policy-Guided Diffusion Inpainting
di: Zhang, Zheyu, et al.
Pubblicazione: (2026) -
Doubling Your Data in Minutes: Ultra-fast Tabular Data Generation via LLM-Induced Dependency Graphs
di: Yang, Shuo, et al.
Pubblicazione: (2025) -
Enriching Tabular Data with Contextual LLM Embeddings: A Comprehensive Ablation Study for Ensemble Classifiers
di: Kasneci, Gjergji, et al.
Pubblicazione: (2024) -
Position: Uncertainty Quantification Needs Reassessment for Large-language Model Agents
di: Kirchhof, Michael, et al.
Pubblicazione: (2025)