Integrating Counterfactual Simulations with Language Models for Explaining Multi-Agent Behaviour
Fuente:
arXiv
Salvato in:
| Autori principali: | Gyevnár, Bálint, Lucas, Christopher G., Albrecht, Stefano V., Cohen, Shay B. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Causal Explanations for Sequential Decision-Making in Multi-Agent Systems
di: Gyevnar, Balint, et al.
Pubblicazione: (2023)
di: Gyevnar, Balint, et al.
Pubblicazione: (2023)
People Attribute Purpose to Autonomous Vehicles When Explaining Their Behavior: Insights from Cognitive Science for Explainable AI
di: Gyevnar, Balint, et al.
Pubblicazione: (2024)
di: Gyevnar, Balint, et al.
Pubblicazione: (2024)
Bridging the Gap in the Responsible AI Divides
di: Gyevnár, Bálint, et al.
Pubblicazione: (2026)
di: Gyevnár, Bálint, et al.
Pubblicazione: (2026)
Objective Metrics for Human-Subjects Evaluation in Explainable Reinforcement Learning
di: Gyevnar, Balint, et al.
Pubblicazione: (2025)
di: Gyevnar, Balint, et al.
Pubblicazione: (2025)
Explainable AI for Safe and Trustworthy Autonomous Driving: A Systematic Review
di: Kuznietsov, Anton, et al.
Pubblicazione: (2024)
di: Kuznietsov, Anton, et al.
Pubblicazione: (2024)
Can Large Language Model Summarizers Adapt to Diverse Scientific Communication Goals?
di: Fonseca, Marcio, et al.
Pubblicazione: (2024)
di: Fonseca, Marcio, et al.
Pubblicazione: (2024)
Large Language Models Relearn Removed Concepts
di: Lo, Michelle, et al.
Pubblicazione: (2024)
di: Lo, Michelle, et al.
Pubblicazione: (2024)
Can Large Language Models Follow Concept Annotation Guidelines? A Case Study on Scientific and Financial Domains
di: Fonseca, Marcio, et al.
Pubblicazione: (2023)
di: Fonseca, Marcio, et al.
Pubblicazione: (2023)
Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective
di: Lee, Jae Hee, et al.
Pubblicazione: (2025)
di: Lee, Jae Hee, et al.
Pubblicazione: (2025)
Explaining 3D Computed Tomography Classifiers with Counterfactuals
di: Cohen, Joseph Paul, et al.
Pubblicazione: (2025)
di: Cohen, Joseph Paul, et al.
Pubblicazione: (2025)
ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment
di: Masters, Charlie, et al.
Pubblicazione: (2025)
di: Masters, Charlie, et al.
Pubblicazione: (2025)
`Keep it Together': Enforcing Cohesion in Extractive Summaries by Simulating Human Memory
di: Cardenas, Ronald, et al.
Pubblicazione: (2024)
di: Cardenas, Ronald, et al.
Pubblicazione: (2024)
Multi-Agent Reinforcement Learning for Energy Networks: Computational Challenges, Progress and Open Problems
di: Keren, Sarah, et al.
Pubblicazione: (2024)
di: Keren, Sarah, et al.
Pubblicazione: (2024)
Rollout Cards: A Reproducibility Standard for Agent Research
di: Masters, Charlie, et al.
Pubblicazione: (2026)
di: Masters, Charlie, et al.
Pubblicazione: (2026)
What can Large Language Models Capture about Code Functional Equivalence?
di: Maveli, Nickil, et al.
Pubblicazione: (2024)
di: Maveli, Nickil, et al.
Pubblicazione: (2024)
DRED: Zero-Shot Transfer in Reinforcement Learning via Data-Regularised Environment Design
di: Garcin, Samuel, et al.
Pubblicazione: (2024)
di: Garcin, Samuel, et al.
Pubblicazione: (2024)
Can LLMs Explain Themselves Counterfactually?
di: Dehghanighobadi, Zahra, et al.
Pubblicazione: (2025)
di: Dehghanighobadi, Zahra, et al.
Pubblicazione: (2025)
Counterfactual Simulation Training for Chain-of-Thought Faithfulness
di: Hase, Peter, et al.
Pubblicazione: (2026)
di: Hase, Peter, et al.
Pubblicazione: (2026)
HyperMARL: Adaptive Hypernetworks for Multi-Agent RL
di: Tessera, Kale-ab Abebe, et al.
Pubblicazione: (2024)
di: Tessera, Kale-ab Abebe, et al.
Pubblicazione: (2024)
Explaining Learned Reward Functions with Counterfactual Trajectories
di: Wehner, Jan, et al.
Pubblicazione: (2024)
di: Wehner, Jan, et al.
Pubblicazione: (2024)
Explaining Reinforcement Learning: A Counterfactual Shapley Values Approach
di: Shi, Yiwei, et al.
Pubblicazione: (2024)
di: Shi, Yiwei, et al.
Pubblicazione: (2024)
Counterfactual Multi-Agent Policy Gradients
di: Foerster, Jakob, et al.
Pubblicazione: (2017)
di: Foerster, Jakob, et al.
Pubblicazione: (2017)
Counterfactual Credit Policy Optimization for Multi-Agent Collaboration
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
Explaining Concept Drift through the Evolution of Group Counterfactuals
di: Stępka, Ignacy, et al.
Pubblicazione: (2025)
di: Stępka, Ignacy, et al.
Pubblicazione: (2025)
Explaining k-Nearest Neighbors: Abductive and Counterfactual Explanations
di: Barceló, Pablo, et al.
Pubblicazione: (2025)
di: Barceló, Pablo, et al.
Pubblicazione: (2025)
Explaining Decentralized Multi-Agent Reinforcement Learning Policies
di: Boggess, Kayla, et al.
Pubblicazione: (2025)
di: Boggess, Kayla, et al.
Pubblicazione: (2025)
Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents
di: Wang, Zihao, et al.
Pubblicazione: (2023)
di: Wang, Zihao, et al.
Pubblicazione: (2023)
Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models
di: Leang, Joshua Ong Jun, et al.
Pubblicazione: (2026)
di: Leang, Joshua Ong Jun, et al.
Pubblicazione: (2026)
Synergistic Simulations: Multi-Agent Problem Solving with Large Language Models
di: Sprigler, Asher, et al.
Pubblicazione: (2024)
di: Sprigler, Asher, et al.
Pubblicazione: (2024)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
di: Deng, Ken, et al.
Pubblicazione: (2026)
di: Deng, Ken, et al.
Pubblicazione: (2026)
Explaining Low Perception Model Competency with High-Competency Counterfactuals
di: Pohland, Sara, et al.
Pubblicazione: (2025)
di: Pohland, Sara, et al.
Pubblicazione: (2025)
Spectral Editing of Activations for Large Language Model Alignment
di: Qiu, Yifu, et al.
Pubblicazione: (2024)
di: Qiu, Yifu, et al.
Pubblicazione: (2024)
The Traitors: Deception and Trust in Multi-Agent Language Model Simulations
di: Curvo, Pedro M. P.
Pubblicazione: (2025)
di: Curvo, Pedro M. P.
Pubblicazione: (2025)
AI Safety for Everyone
di: Gyevnar, Balint, et al.
Pubblicazione: (2025)
di: Gyevnar, Balint, et al.
Pubblicazione: (2025)
Modeling News Interactions and Influence for Financial Market Prediction
di: Wang, Mengyu, et al.
Pubblicazione: (2024)
di: Wang, Mengyu, et al.
Pubblicazione: (2024)
Can LLMs Compress (and Decompress)? Evaluating Code Understanding and Execution via Invertibility
di: Maveli, Nickil, et al.
Pubblicazione: (2026)
di: Maveli, Nickil, et al.
Pubblicazione: (2026)
Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions
di: Neo, Clement, et al.
Pubblicazione: (2024)
di: Neo, Clement, et al.
Pubblicazione: (2024)
Used Car Salesbots? Honesty and Credulity of LLMs as Bargaining Agents under Partial Information
di: Miceli-Barone, Antonio Valerio, et al.
Pubblicazione: (2026)
di: Miceli-Barone, Antonio Valerio, et al.
Pubblicazione: (2026)
Does Using Counterfactual Help LLMs Explain Textual Importance in Classification?
di: Tan, Nelvin, et al.
Pubblicazione: (2025)
di: Tan, Nelvin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Causal Explanations for Sequential Decision-Making in Multi-Agent Systems
di: Gyevnar, Balint, et al.
Pubblicazione: (2023) -
People Attribute Purpose to Autonomous Vehicles When Explaining Their Behavior: Insights from Cognitive Science for Explainable AI
di: Gyevnar, Balint, et al.
Pubblicazione: (2024) -
Bridging the Gap in the Responsible AI Divides
di: Gyevnár, Bálint, et al.
Pubblicazione: (2026) -
Objective Metrics for Human-Subjects Evaluation in Explainable Reinforcement Learning
di: Gyevnar, Balint, et al.
Pubblicazione: (2025) -
Explainable AI for Safe and Trustworthy Autonomous Driving: A Systematic Review
di: Kuznietsov, Anton, et al.
Pubblicazione: (2024)