Emergent Persuasion: Will LLMs Persuade Without Being Prompted?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chang, Vincent, Ho, Thee, Dev, Sunishchal, Zhu, Kevin, Feng, Shi, Pelrine, Kellin, Kowal, Matthew |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
It's the Thought that Counts: Evaluating the Attempts of Frontier LLMs to Persuade on Harmful Topics
par: Kowal, Matthew, et autres
Publié: (2025)
par: Kowal, Matthew, et autres
Publié: (2025)
Limits of Emergent Reasoning of Large Language Models in Agentic Frameworks for Deterministic Games
par: Su, Chris, et autres
Publié: (2025)
par: Su, Chris, et autres
Publié: (2025)
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
par: Thomas, Rohan Subramanian, et autres
Publié: (2026)
par: Thomas, Rohan Subramanian, et autres
Publié: (2026)
Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
par: Struppek, Lukas, et autres
Publié: (2026)
par: Struppek, Lukas, et autres
Publié: (2026)
How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs
par: Zeng, Yi, et autres
Publié: (2024)
par: Zeng, Yi, et autres
Publié: (2024)
Scaling Trends for Data Poisoning in LLMs
par: Bowen, Dillon, et autres
Publié: (2024)
par: Bowen, Dillon, et autres
Publié: (2024)
Combining Confidence Elicitation and Sample-based Methods for Uncertainty Quantification in Misinformation Mitigation
par: Rivera, Mauricio, et autres
Publié: (2024)
par: Rivera, Mauricio, et autres
Publié: (2024)
Large language models can effectively convince people to believe conspiracies
par: Costello, Thomas H., et autres
Publié: (2026)
par: Costello, Thomas H., et autres
Publié: (2026)
Broken Chains: The Cost of Incomplete Reasoning in LLMs
par: Su, Ian, et autres
Publié: (2026)
par: Su, Ian, et autres
Publié: (2026)
Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards
par: Pandey, Punya Syon, et autres
Publié: (2025)
par: Pandey, Punya Syon, et autres
Publié: (2025)
Concept Influence: Leveraging Interpretability to Improve Performance and Efficiency in Training Data Attribution
par: Kowal, Matthew, et autres
Publié: (2026)
par: Kowal, Matthew, et autres
Publié: (2026)
How Do LLMs Persuade? Linear Probes Can Uncover Persuasion Dynamics in Multi-Turn Conversations
par: Jaipersaud, Brandon, et autres
Publié: (2025)
par: Jaipersaud, Brandon, et autres
Publié: (2025)
Can Go AIs be adversarially robust?
par: Tseng, Tom, et autres
Publié: (2024)
par: Tseng, Tom, et autres
Publié: (2024)
Visualizing and Benchmarking LLM Factual Hallucination Tendencies via Internal State Analysis and Clustering
par: Mao, Nathan, et autres
Publié: (2026)
par: Mao, Nathan, et autres
Publié: (2026)
TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering
par: Hossain, Saad, et autres
Publié: (2026)
par: Hossain, Saad, et autres
Publié: (2026)
Persuadability and LLMs as Legal Decision Tools
par: Suttle, Oisin, et autres
Publié: (2026)
par: Suttle, Oisin, et autres
Publié: (2026)
When Agents Persuade: Rhetoric Generation and Mitigation in LLMs
par: Jose, Julia, et autres
Publié: (2026)
par: Jose, Julia, et autres
Publié: (2026)
Uncertainty Resolution in Misinformation Detection
par: Orlovskiy, Yury, et autres
Publié: (2024)
par: Orlovskiy, Yury, et autres
Publié: (2024)
Judge Reliability Harness: Stress Testing the Reliability of LLM Judges
par: Dev, Sunishchal, et autres
Publié: (2026)
par: Dev, Sunishchal, et autres
Publié: (2026)
When AI Gets Persuaded, Humans Follow: Inducing the Conformity Effect in Persuasive Dialogue
par: Sasaki, Rikuo, et autres
Publié: (2025)
par: Sasaki, Rikuo, et autres
Publié: (2025)
LLM Can be a Dangerous Persuader: Empirical Study of Persuasion Safety in Large Language Models
par: Liu, Minqian, et autres
Publié: (2025)
par: Liu, Minqian, et autres
Publié: (2025)
Exploiting Novel GPT-4 APIs
par: Pelrine, Kellin, et autres
Publié: (2023)
par: Pelrine, Kellin, et autres
Publié: (2023)
Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
par: Egbuna, Nathan, et autres
Publié: (2025)
par: Egbuna, Nathan, et autres
Publié: (2025)
PALADIN: Self-Correcting Language Model Agents to Cure Tool-Failure Cases
par: Vuddanti, Sri Vatsa, et autres
Publié: (2025)
par: Vuddanti, Sri Vatsa, et autres
Publié: (2025)
How LLMs Are Persuaded: A Few Attention Heads, Rerouted
par: Sun, Xiangkun, et autres
Publié: (2026)
par: Sun, Xiangkun, et autres
Publié: (2026)
Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs
par: Chaturvedi, Isha, et autres
Publié: (2025)
par: Chaturvedi, Isha, et autres
Publié: (2025)
CA-BED: Conversation-Aware Bayesian Experimental Design
par: Arnould, Daniel, et autres
Publié: (2026)
par: Arnould, Daniel, et autres
Publié: (2026)
Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models
par: Bozdag, Nimet Beyza, et autres
Publié: (2025)
par: Bozdag, Nimet Beyza, et autres
Publié: (2025)
Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility
par: Murphy, Brendan, et autres
Publié: (2025)
par: Murphy, Brendan, et autres
Publié: (2025)
DuoLens: A Framework for Robust Detection of Machine-Generated Multilingual Text and Code
par: Agrawal, Shriyansh, et autres
Publié: (2025)
par: Agrawal, Shriyansh, et autres
Publié: (2025)
Perceived Political Bias in LLMs Reduces Persuasive Abilities
par: DiGiuseppe, Matthew, et autres
Publié: (2026)
par: DiGiuseppe, Matthew, et autres
Publié: (2026)
FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness
par: Swaroop, Anand, et autres
Publié: (2025)
par: Swaroop, Anand, et autres
Publié: (2025)
Successful Misunderstandings: Learning to Coordinate Without Being Understood
par: Kondylidis, Nikolaos, et autres
Publié: (2025)
par: Kondylidis, Nikolaos, et autres
Publié: (2025)
$\texttt{BluePrint}$: A Social Media User Dataset for LLM Persona Evaluation and Training
par: Bück-Kaeffer, Aurélien, et autres
Publié: (2025)
par: Bück-Kaeffer, Aurélien, et autres
Publié: (2025)
A Persuasion-Based Prompt Learning Approach to Improve Smishing Detection through Data Augmentation
par: Shim, Ho Sung, et autres
Publié: (2024)
par: Shim, Ho Sung, et autres
Publié: (2024)
SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought
par: Batra, Shourya, et autres
Publié: (2025)
par: Batra, Shourya, et autres
Publié: (2025)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
par: Gibbs, Tom, et autres
Publié: (2024)
par: Gibbs, Tom, et autres
Publié: (2024)
How Persuasive is Your Context?
par: Nguyen, Tu, et autres
Publié: (2025)
par: Nguyen, Tu, et autres
Publié: (2025)
From Intuition to Understanding: Using AI Peers to Overcome Physics Misconceptions
par: Weijers, Ruben, et autres
Publié: (2025)
par: Weijers, Ruben, et autres
Publié: (2025)
Documents similaires
-
It's the Thought that Counts: Evaluating the Attempts of Frontier LLMs to Persuade on Harmful Topics
par: Kowal, Matthew, et autres
Publié: (2025) -
Limits of Emergent Reasoning of Large Language Models in Agentic Frameworks for Deterministic Games
par: Su, Chris, et autres
Publié: (2025) -
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
par: Thomas, Rohan Subramanian, et autres
Publié: (2026) -
Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
par: Struppek, Lukas, et autres
Publié: (2026) -
How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs
par: Zeng, Yi, et autres
Publié: (2024)