Head-Specific Intervention Can Induce Misaligned AI Coordination in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Darm, Paul, Riccardi, Annalisa |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Inference-Time Intervention in Large Language Models for Reliable Requirement Verification
di: Darm, Paul, et al.
Pubblicazione: (2025)
di: Darm, Paul, et al.
Pubblicazione: (2025)
Model Misalignment and Language Change: Traces of AI-Associated Language in Unscripted Spoken English
di: Anderson, Bryce, et al.
Pubblicazione: (2025)
di: Anderson, Bryce, et al.
Pubblicazione: (2025)
Eliciting Problem Specifications via Large Language Models
di: Wray, Robert E., et al.
Pubblicazione: (2024)
di: Wray, Robert E., et al.
Pubblicazione: (2024)
Can Large Language Models perform Relation-based Argument Mining?
di: Gorur, Deniz, et al.
Pubblicazione: (2024)
di: Gorur, Deniz, et al.
Pubblicazione: (2024)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
di: Peters, Sydney, et al.
Pubblicazione: (2025)
di: Peters, Sydney, et al.
Pubblicazione: (2025)
Inference to the Best Explanation in Large Language Models
di: Dalal, Dhairya, et al.
Pubblicazione: (2024)
di: Dalal, Dhairya, et al.
Pubblicazione: (2024)
BLT: Can Large Language Models Handle Basic Legal Text?
di: Blair-Stanek, Andrew, et al.
Pubblicazione: (2023)
di: Blair-Stanek, Andrew, et al.
Pubblicazione: (2023)
PustakAI: Curriculum-Aligned and Interactive Textbooks Using Large Language Models
di: Sharma, Shivam, et al.
Pubblicazione: (2025)
di: Sharma, Shivam, et al.
Pubblicazione: (2025)
Can Large Language Models Grasp Legal Theories? Enhance Legal Reasoning with Insights from Multi-Agent Collaboration
di: Yuan, Weikang, et al.
Pubblicazione: (2024)
di: Yuan, Weikang, et al.
Pubblicazione: (2024)
Large Language Models Can Better Understand Knowledge Graphs Than We Thought
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
Large Language Model (LLM) Bias Index -- LLMBI
di: Oketunji, Abiodun Finbarrs, et al.
Pubblicazione: (2023)
di: Oketunji, Abiodun Finbarrs, et al.
Pubblicazione: (2023)
Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models
di: Hu, Zhibo, et al.
Pubblicazione: (2026)
di: Hu, Zhibo, et al.
Pubblicazione: (2026)
Robustness of Large Language Models to Perturbations in Text
di: Singh, Ayush, et al.
Pubblicazione: (2024)
di: Singh, Ayush, et al.
Pubblicazione: (2024)
Evaluating Class Membership Relations in Knowledge Graphs using Large Language Models
di: Allen, Bradley P., et al.
Pubblicazione: (2024)
di: Allen, Bradley P., et al.
Pubblicazione: (2024)
On the Effectiveness of LLM-Specific Fine-Tuning for Detecting AI-Generated Text
di: Gromadzki, Michał, et al.
Pubblicazione: (2026)
di: Gromadzki, Michał, et al.
Pubblicazione: (2026)
PetKaz at SemEval-2024 Task 8: Can Linguistics Capture the Specifics of LLM-generated Text?
di: Petukhova, Kseniia, et al.
Pubblicazione: (2024)
di: Petukhova, Kseniia, et al.
Pubblicazione: (2024)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
SimLM: Can Language Models Infer Parameters of Physical Systems?
di: Memery, Sean, et al.
Pubblicazione: (2023)
di: Memery, Sean, et al.
Pubblicazione: (2023)
Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
A comprehensive taxonomy of hallucinations in Large Language Models
di: Cossio, Manuel
Pubblicazione: (2025)
di: Cossio, Manuel
Pubblicazione: (2025)
Streamlining Redundant Layers to Compress Large Language Models
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
Integrating Emotional and Linguistic Models for Ethical Compliance in Large Language Models
di: Chang, Edward Y.
Pubblicazione: (2024)
di: Chang, Edward Y.
Pubblicazione: (2024)
Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems
di: Fukui, Hiroki
Pubblicazione: (2026)
di: Fukui, Hiroki
Pubblicazione: (2026)
Bielik 11B v3: Multilingual Large Language Model for European Languages
di: Ociepa, Krzysztof, et al.
Pubblicazione: (2025)
di: Ociepa, Krzysztof, et al.
Pubblicazione: (2025)
Artificial Phantasia: Emergent Mental Imagery in Large Language Models
di: McCarty, Morgan, et al.
Pubblicazione: (2025)
di: McCarty, Morgan, et al.
Pubblicazione: (2025)
Prompt-Time Symbolic Knowledge Capture with Large Language Models
di: Çöplü, Tolga, et al.
Pubblicazione: (2024)
di: Çöplü, Tolga, et al.
Pubblicazione: (2024)
Argumentative Large Language Models for Explainable and Contestable Claim Verification
di: Freedman, Gabriel, et al.
Pubblicazione: (2024)
di: Freedman, Gabriel, et al.
Pubblicazione: (2024)
PatentGPT: A Large Language Model for Intellectual Property
di: Bai, Zilong, et al.
Pubblicazione: (2024)
di: Bai, Zilong, et al.
Pubblicazione: (2024)
Reasoning over Uncertain Text by Generative Large Language Models
di: Nafar, Aliakbar, et al.
Pubblicazione: (2024)
di: Nafar, Aliakbar, et al.
Pubblicazione: (2024)
Multi-Turn Interactions for Text-to-SQL with Large Language Models
di: Xiong, Guanming, et al.
Pubblicazione: (2024)
di: Xiong, Guanming, et al.
Pubblicazione: (2024)
Demystifying Instruction Mixing for Fine-tuning Large Language Models
di: Wang, Renxi, et al.
Pubblicazione: (2023)
di: Wang, Renxi, et al.
Pubblicazione: (2023)
EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models
di: Paech, Samuel J.
Pubblicazione: (2023)
di: Paech, Samuel J.
Pubblicazione: (2023)
Can AI Extract Antecedent Factors of Human Trust in AI? An Application of Information Extraction for Scientific Literature in Behavioural and Computer Sciences
di: McGrath, Melanie, et al.
Pubblicazione: (2024)
di: McGrath, Melanie, et al.
Pubblicazione: (2024)
Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Models
di: Benkirane, Kenza, et al.
Pubblicazione: (2024)
di: Benkirane, Kenza, et al.
Pubblicazione: (2024)
Weber's Law in Transformer Magnitude Representations: Efficient Coding, Representational Geometry, and Psychophysical Laws in Language Models
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
Search-R3: Unifying Reasoning and Embedding in Large Language Models
di: Gui, Yuntao, et al.
Pubblicazione: (2025)
di: Gui, Yuntao, et al.
Pubblicazione: (2025)
EMNLP: Educator-role Moral and Normative Large Language Models Profiling
di: Jiang, Yilin, et al.
Pubblicazione: (2025)
di: Jiang, Yilin, et al.
Pubblicazione: (2025)
Assistive Large Language Model Agents for Socially-Aware Negotiation Dialogues
di: Hua, Yuncheng, et al.
Pubblicazione: (2024)
di: Hua, Yuncheng, et al.
Pubblicazione: (2024)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
di: Saji, Alan, et al.
Pubblicazione: (2025)
di: Saji, Alan, et al.
Pubblicazione: (2025)
Predictive Simultaneous Interpretation: Harnessing Large Language Models for Democratizing Real-Time Multilingual Communication
di: Iida, Kurando, et al.
Pubblicazione: (2024)
di: Iida, Kurando, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Inference-Time Intervention in Large Language Models for Reliable Requirement Verification
di: Darm, Paul, et al.
Pubblicazione: (2025) -
Model Misalignment and Language Change: Traces of AI-Associated Language in Unscripted Spoken English
di: Anderson, Bryce, et al.
Pubblicazione: (2025) -
Eliciting Problem Specifications via Large Language Models
di: Wray, Robert E., et al.
Pubblicazione: (2024) -
Can Large Language Models perform Relation-based Argument Mining?
di: Gorur, Deniz, et al.
Pubblicazione: (2024) -
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
di: Peters, Sydney, et al.
Pubblicazione: (2025)