Deceive, Detect, and Disclose: Large Language Models Play Mini-Mafia
Fuente:
arXiv
Salvato in:
| Autori principali: | Costa, Davi Bastos, Vicente, Renato |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models
di: Costa, Davi Bastos, et al.
Pubblicazione: (2025)
di: Costa, Davi Bastos, et al.
Pubblicazione: (2025)
Persona-Model Collapse in Emergent Misalignment
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
Flattering to Deceive: The Impact of Sycophantic Behavior on User Trust in Large Language Model
di: Carro, María Victoria
Pubblicazione: (2024)
di: Carro, María Victoria
Pubblicazione: (2024)
Are Your Agents Upward Deceivers?
di: Guo, Dadi, et al.
Pubblicazione: (2025)
di: Guo, Dadi, et al.
Pubblicazione: (2025)
Large Language Models can Strategically Deceive their Users when Put Under Pressure
di: Scheurer, Jérémy, et al.
Pubblicazione: (2023)
di: Scheurer, Jérémy, et al.
Pubblicazione: (2023)
HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense
di: Li, Siyuan, et al.
Pubblicazione: (2026)
di: Li, Siyuan, et al.
Pubblicazione: (2026)
Seeing is Deceiving: Exploitation of Visual Pathways in Multi-Modal Language Models
di: Janowczyk, Pete, et al.
Pubblicazione: (2024)
di: Janowczyk, Pete, et al.
Pubblicazione: (2024)
Adversarial Magnification to Deceive Deepfake Detection through Super Resolution
di: Coccomini, Davide Alessandro, et al.
Pubblicazione: (2024)
di: Coccomini, Davide Alessandro, et al.
Pubblicazione: (2024)
MiniLLM: On-Policy Distillation of Large Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2023)
di: Gu, Yuxian, et al.
Pubblicazione: (2023)
Role-Playing Evaluation for Large Language Models
di: Boudouri, Yassine El, et al.
Pubblicazione: (2025)
di: Boudouri, Yassine El, et al.
Pubblicazione: (2025)
MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Classification and Detection
di: Moglia, Andrea, et al.
Pubblicazione: (2024)
di: Moglia, Andrea, et al.
Pubblicazione: (2024)
Can Large Language Models Play Games? A Case Study of A Self-Play Approach
di: Guo, Hongyi, et al.
Pubblicazione: (2024)
di: Guo, Hongyi, et al.
Pubblicazione: (2024)
Fairness Testing of Large Language Models in Role-Playing
di: Li, Xinyue, et al.
Pubblicazione: (2024)
di: Li, Xinyue, et al.
Pubblicazione: (2024)
Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
NetDiffuser: Deceiving DNN-Based Network Attack Detection Systems with Diffusion-Generated Adversarial Traffic
di: Kumar, Pratyay, et al.
Pubblicazione: (2026)
di: Kumar, Pratyay, et al.
Pubblicazione: (2026)
Knowledge Graph-enhanced Large Language Model for Incremental Game PlayTesting
di: Mu, Enhong, et al.
Pubblicazione: (2025)
di: Mu, Enhong, et al.
Pubblicazione: (2025)
How to Disclose? Strategic AI Disclosure in Crowdfunding
di: Wang, Ning, et al.
Pubblicazione: (2026)
di: Wang, Ning, et al.
Pubblicazione: (2026)
Stop Comparing LLM Agents Without Disclosing the Harness
di: Zhang, Yunbei, et al.
Pubblicazione: (2026)
di: Zhang, Yunbei, et al.
Pubblicazione: (2026)
RSPO: Regularized Self-Play Alignment of Large Language Models
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
From Code to Play: Benchmarking Program Search for Games Using Large Language Models
di: Eberhardinger, Manuel, et al.
Pubblicazione: (2024)
di: Eberhardinger, Manuel, et al.
Pubblicazione: (2024)
Deceiving Question-Answering Models: A Hybrid Word-Level Adversarial Approach
di: Li, Jiyao, et al.
Pubblicazione: (2024)
di: Li, Jiyao, et al.
Pubblicazione: (2024)
TRAPDOC: Deceiving LLM Users by Injecting Imperceptible Phantom Tokens into Documents
di: Jin, Hyundong, et al.
Pubblicazione: (2025)
di: Jin, Hyundong, et al.
Pubblicazione: (2025)
RPGBENCH: Evaluating Large Language Models as Role-Playing Game Engines
di: Yu, Pengfei, et al.
Pubblicazione: (2025)
di: Yu, Pengfei, et al.
Pubblicazione: (2025)
On the Decision-Making Abilities in Role-Playing using Large Language Models
di: Shen, Chenglei, et al.
Pubblicazione: (2024)
di: Shen, Chenglei, et al.
Pubblicazione: (2024)
Time to Talk: LLM Agents for Asynchronous Group Communication in Mafia Games
di: Eckhaus, Niv, et al.
Pubblicazione: (2025)
di: Eckhaus, Niv, et al.
Pubblicazione: (2025)
Large Language Models Play StarCraft II: Benchmarks and A Chain of Summarization Approach
di: Ma, Weiyu, et al.
Pubblicazione: (2023)
di: Ma, Weiyu, et al.
Pubblicazione: (2023)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
di: Liu, Akide, et al.
Pubblicazione: (2024)
di: Liu, Akide, et al.
Pubblicazione: (2024)
Quantifying Risk Propensities of Large Language Models: Ethical Focus and Bias Detection through Role-Play
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
Credence Calibration Game? Calibrating Large Language Models through Structured Play
di: Fang, Ke, et al.
Pubblicazione: (2025)
di: Fang, Ke, et al.
Pubblicazione: (2025)
Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation
di: Jain, Daksh, et al.
Pubblicazione: (2025)
di: Jain, Daksh, et al.
Pubblicazione: (2025)
Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models
di: Cao, Jiaqi, et al.
Pubblicazione: (2025)
di: Cao, Jiaqi, et al.
Pubblicazione: (2025)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
di: Deng, Yang, et al.
Pubblicazione: (2023)
di: Deng, Yang, et al.
Pubblicazione: (2023)
PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models
di: Shi, Wenlong, et al.
Pubblicazione: (2026)
di: Shi, Wenlong, et al.
Pubblicazione: (2026)
What if Othello-Playing Language Models Could See?
di: Chen, Xinyi, et al.
Pubblicazione: (2025)
di: Chen, Xinyi, et al.
Pubblicazione: (2025)
Deceptive Risk Minimization: Out-of-Distribution Generalization by Deceiving Distribution Shift Detectors
di: Majumdar, Anirudha
Pubblicazione: (2025)
di: Majumdar, Anirudha
Pubblicazione: (2025)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
di: Jiao, Pengkun, et al.
Pubblicazione: (2025)
di: Jiao, Pengkun, et al.
Pubblicazione: (2025)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
di: Fang, Wenkai, et al.
Pubblicazione: (2025)
di: Fang, Wenkai, et al.
Pubblicazione: (2025)
Orca: Enhancing Role-Playing Abilities of Large Language Models by Integrating Personality Traits
di: Huang, Yuxuan
Pubblicazione: (2024)
di: Huang, Yuxuan
Pubblicazione: (2024)
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
di: Wang, Zekun Moore, et al.
Pubblicazione: (2023)
di: Wang, Zekun Moore, et al.
Pubblicazione: (2023)
Large Language Models Playing Mixed Strategy Nash Equilibrium Games
di: Silva, Alonso
Pubblicazione: (2024)
di: Silva, Alonso
Pubblicazione: (2024)
Documenti analoghi
-
Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models
di: Costa, Davi Bastos, et al.
Pubblicazione: (2025) -
Persona-Model Collapse in Emergent Misalignment
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026) -
Flattering to Deceive: The Impact of Sycophantic Behavior on User Trust in Large Language Model
di: Carro, María Victoria
Pubblicazione: (2024) -
Are Your Agents Upward Deceivers?
di: Guo, Dadi, et al.
Pubblicazione: (2025) -
Large Language Models can Strategically Deceive their Users when Put Under Pressure
di: Scheurer, Jérémy, et al.
Pubblicazione: (2023)