Lessons Learned from Evaluation of LLM based Multi-agents in Safer Therapy Recommendation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Yicong, Chen, Ting, Hochberg, Irit, Sun, Zhoujian, Edry, Ruth, Huang, Zhengxing, Peleg, Mor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Conversational Disease Diagnosis via External Planner-Controlled Large Language Models
di: Sun, Zhoujian, et al.
Pubblicazione: (2024)
di: Sun, Zhoujian, et al.
Pubblicazione: (2024)
Improving Interactive Diagnostic Ability of a Large Language Model Agent Through Clinical Experience Learning
di: Sun, Zhoujian, et al.
Pubblicazione: (2025)
di: Sun, Zhoujian, et al.
Pubblicazione: (2025)
anyECG-chat: A Generalist ECG-MLLM for Flexible ECG Input and Multi-Task Understanding
di: Li, Haitao, et al.
Pubblicazione: (2025)
di: Li, Haitao, et al.
Pubblicazione: (2025)
M$^{2}$GRPO: Mamba-based Multi-Agent Group Relative Policy Optimization for Biomimetic Underwater Robots Pursuit
di: Feng, Yukai, et al.
Pubblicazione: (2026)
di: Feng, Yukai, et al.
Pubblicazione: (2026)
A Theory of Intelligences
di: Hochberg, Michael E.
Pubblicazione: (2023)
di: Hochberg, Michael E.
Pubblicazione: (2023)
Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts
di: Chen, Hongyu, et al.
Pubblicazione: (2025)
di: Chen, Hongyu, et al.
Pubblicazione: (2025)
ReCode: Improving LLM-based Code Repair with Fine-Grained Retrieval-Augmented Generation
di: Zhao, Yicong, et al.
Pubblicazione: (2025)
di: Zhao, Yicong, et al.
Pubblicazione: (2025)
SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration
di: Pan, Yu, et al.
Pubblicazione: (2026)
di: Pan, Yu, et al.
Pubblicazione: (2026)
Models That Know How Evaluations Are Designed Score Safer
di: Deckenbach, Katharina, et al.
Pubblicazione: (2026)
di: Deckenbach, Katharina, et al.
Pubblicazione: (2026)
Towards Simulating Social Influence Dynamics with LLM-based Multi-agents
di: Lin, Hsien-Tsung, et al.
Pubblicazione: (2025)
di: Lin, Hsien-Tsung, et al.
Pubblicazione: (2025)
Adaptive and Robust DBSCAN with Multi-agent Reinforcement Learning
di: Peng, Hao, et al.
Pubblicazione: (2025)
di: Peng, Hao, et al.
Pubblicazione: (2025)
DynaSwarm: Dynamically Graph Structure Selection for LLM-based Multi-agent System
di: Leong, Hui Yi, et al.
Pubblicazione: (2025)
di: Leong, Hui Yi, et al.
Pubblicazione: (2025)
LipoAgent: Coordinating Fine-Tuned LLM Agents for Safer Lipid Design
di: Li, Leshu, et al.
Pubblicazione: (2026)
di: Li, Leshu, et al.
Pubblicazione: (2026)
ResMAS: Resilience Optimization in LLM-based Multi-agent Systems
di: Zhou, Zhilun, et al.
Pubblicazione: (2026)
di: Zhou, Zhilun, et al.
Pubblicazione: (2026)
Multi-Modal Hypergraph Enhanced LLM Learning for Recommendation
di: Guo, Xu, et al.
Pubblicazione: (2025)
di: Guo, Xu, et al.
Pubblicazione: (2025)
Conversational AI for Automated Patient Questionnaire Completion: Development Insights and Design Principles
di: Navarro, David Fraile, et al.
Pubblicazione: (2026)
di: Navarro, David Fraile, et al.
Pubblicazione: (2026)
Behavior Alignment: A New Perspective of Evaluating LLM-based Conversational Recommender Systems
di: Yang, Dayu, et al.
Pubblicazione: (2024)
di: Yang, Dayu, et al.
Pubblicazione: (2024)
Learn to Disguise: Avoid Refusal Responses in LLM's Defense via a Multi-agent Attacker-Disguiser Game
di: Xu, Qianqiao, et al.
Pubblicazione: (2024)
di: Xu, Qianqiao, et al.
Pubblicazione: (2024)
Eliminating Out-of-Domain Recommendations in LLM-based Recommender Systems: A Unified View
di: Liao, Hao, et al.
Pubblicazione: (2025)
di: Liao, Hao, et al.
Pubblicazione: (2025)
Agentic Moderation: Multi-Agent Design for Safer Vision-Language Models
di: Ren, Juan, et al.
Pubblicazione: (2025)
di: Ren, Juan, et al.
Pubblicazione: (2025)
Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies
di: Brehme, Lorenz, et al.
Pubblicazione: (2026)
di: Brehme, Lorenz, et al.
Pubblicazione: (2026)
LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions
di: Sun, Chuanneng, et al.
Pubblicazione: (2024)
di: Sun, Chuanneng, et al.
Pubblicazione: (2024)
A Survey on LLM-based News Recommender Systems
di: Wang, Rongyao, et al.
Pubblicazione: (2025)
di: Wang, Rongyao, et al.
Pubblicazione: (2025)
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents
di: Zhu, Kunlun, et al.
Pubblicazione: (2025)
di: Zhu, Kunlun, et al.
Pubblicazione: (2025)
FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
di: Jin, Song, et al.
Pubblicazione: (2025)
di: Jin, Song, et al.
Pubblicazione: (2025)
On Safer Reinforcement Learning for Sedation and Analgesia in Intensive Care
di: Romero-Hernandez, Joel, et al.
Pubblicazione: (2026)
di: Romero-Hernandez, Joel, et al.
Pubblicazione: (2026)
Graph Neural Networks with Model-based Reinforcement Learning for Multi-agent Systems
di: Chen, Hanxiao
Pubblicazione: (2024)
di: Chen, Hanxiao
Pubblicazione: (2024)
De-biased Multimodal Electrocardiogram Analysis
di: Li, Haitao, et al.
Pubblicazione: (2024)
di: Li, Haitao, et al.
Pubblicazione: (2024)
Towards Safer AI Moderation: Evaluating LLM Moderators Through a Unified Benchmark Dataset and Advocating a Human-First Approach
di: Machlovi, Naseem, et al.
Pubblicazione: (2025)
di: Machlovi, Naseem, et al.
Pubblicazione: (2025)
Thinking agents for zero-shot generalization to qualitatively novel tasks
di: Miconi, Thomas, et al.
Pubblicazione: (2025)
di: Miconi, Thomas, et al.
Pubblicazione: (2025)
Multi-agent Attacks for Black-box Social Recommendations
di: Wang, Shijie, et al.
Pubblicazione: (2023)
di: Wang, Shijie, et al.
Pubblicazione: (2023)
RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation
di: Chen, Shuhao, et al.
Pubblicazione: (2026)
di: Chen, Shuhao, et al.
Pubblicazione: (2026)
CURE:Circuit-Aware Unlearning for LLM-based Recommendation
di: Chen, Ziheng, et al.
Pubblicazione: (2026)
di: Chen, Ziheng, et al.
Pubblicazione: (2026)
Causality Model for Semantic Understanding on Videos
di: Yicong, Li
Pubblicazione: (2025)
di: Yicong, Li
Pubblicazione: (2025)
Synchrony as a Therapeutic Framework: Synchronization Modulation Transitions Model through Sensorimotor Art Therapy
di: Shochat, Irit
Pubblicazione: (2025)
di: Shochat, Irit
Pubblicazione: (2025)
Tracking Capabilities for Safer Agents
di: Odersky, Martin, et al.
Pubblicazione: (2026)
di: Odersky, Martin, et al.
Pubblicazione: (2026)
E-mem: Multi-agent based Episodic Context Reconstruction for LLM Agent Memory
di: Wang, Kaixiang, et al.
Pubblicazione: (2026)
di: Wang, Kaixiang, et al.
Pubblicazione: (2026)
Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning
di: Hazra, Somnath, et al.
Pubblicazione: (2025)
di: Hazra, Somnath, et al.
Pubblicazione: (2025)
LLM Chemistry Estimation for Multi-LLM Recommendation
di: Sanchez, Huascar, et al.
Pubblicazione: (2025)
di: Sanchez, Huascar, et al.
Pubblicazione: (2025)
Contrastive Learning Method for Sequential Recommendation based on Multi-Intention Disentanglement
di: Hu, Zeyu, et al.
Pubblicazione: (2024)
di: Hu, Zeyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Conversational Disease Diagnosis via External Planner-Controlled Large Language Models
di: Sun, Zhoujian, et al.
Pubblicazione: (2024) -
Improving Interactive Diagnostic Ability of a Large Language Model Agent Through Clinical Experience Learning
di: Sun, Zhoujian, et al.
Pubblicazione: (2025) -
anyECG-chat: A Generalist ECG-MLLM for Flexible ECG Input and Multi-Task Understanding
di: Li, Haitao, et al.
Pubblicazione: (2025) -
M$^{2}$GRPO: Mamba-based Multi-Agent Group Relative Policy Optimization for Biomimetic Underwater Robots Pursuit
di: Feng, Yukai, et al.
Pubblicazione: (2026) -
A Theory of Intelligences
di: Hochberg, Michael E.
Pubblicazione: (2023)