TAMA: Tool-Augmented Multimodal Agent for Procedural Activity Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Hasegawa, Kimihiro, Imrattanatrai, Wiradee, Asada, Masaki, Fukuda, Ken, Mitamura, Teruko |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ProMQA: Question Answering Dataset for Multimodal Procedural Activity Understanding
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2024)
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2024)
A Video-grounded Dialogue Dataset and Metric for Event-driven Activities
di: Imrattanatrai, Wiradee, et al.
Pubblicazione: (2025)
di: Imrattanatrai, Wiradee, et al.
Pubblicazione: (2025)
ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2025)
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2025)
Formulation Comparison for Timeline Construction using LLMs
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2024)
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2024)
Scaling Multi-Document Event Summarization: Evaluating Compression vs. Full-Text Approaches
di: Pratapa, Adithya, et al.
Pubblicazione: (2025)
di: Pratapa, Adithya, et al.
Pubblicazione: (2025)
Estimating Optimal Context Length for Hybrid Retrieval-augmented Multi-document Summarization
di: Pratapa, Adithya, et al.
Pubblicazione: (2025)
di: Pratapa, Adithya, et al.
Pubblicazione: (2025)
Can AI Examine Novelty of Patents?: Novelty Evaluation Based on the Correspondence between Patent Claim and Prior Art
di: Ikoma, Hayato, et al.
Pubblicazione: (2025)
di: Ikoma, Hayato, et al.
Pubblicazione: (2025)
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
di: Bertsch, Amanda, et al.
Pubblicazione: (2025)
di: Bertsch, Amanda, et al.
Pubblicazione: (2025)
ColBERT Retrieval and Ensemble Response Scoring for Language Model Question Answering
di: Gichamba, Alex, et al.
Pubblicazione: (2024)
di: Gichamba, Alex, et al.
Pubblicazione: (2024)
HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities
di: Egami, Shusaku, et al.
Pubblicazione: (2026)
di: Egami, Shusaku, et al.
Pubblicazione: (2026)
TAMA: A Human-AI Collaborative Thematic Analysis Framework Using Multi-Agent LLMs for Clinical Interviews
di: Xu, Huimin, et al.
Pubblicazione: (2025)
di: Xu, Huimin, et al.
Pubblicazione: (2025)
Multilingual Open QA on the MIA Shared Task
di: Yarrabelly, Navya, et al.
Pubblicazione: (2025)
di: Yarrabelly, Navya, et al.
Pubblicazione: (2025)
LIT-RAGBench: Benchmarking Generator Capabilities of Large Language Models in Retrieval-Augmented Generation
di: Itai, Koki, et al.
Pubblicazione: (2026)
di: Itai, Koki, et al.
Pubblicazione: (2026)
Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals
di: Wu, Te-Lin, et al.
Pubblicazione: (2021)
di: Wu, Te-Lin, et al.
Pubblicazione: (2021)
ReflecTool: Towards Reflection-Aware Tool-Augmented Clinical Agents
di: Liao, Yusheng, et al.
Pubblicazione: (2024)
di: Liao, Yusheng, et al.
Pubblicazione: (2024)
DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
ToolMem: Enhancing Multimodal Agents with Learnable Tool Capability Memory
di: Xiao, Yunzhong, et al.
Pubblicazione: (2025)
di: Xiao, Yunzhong, et al.
Pubblicazione: (2025)
Tool-MCoT: Tool Augmented Multimodal Chain-of-Thought for Content Safety Moderation
di: Zhang, Shutong, et al.
Pubblicazione: (2026)
di: Zhang, Shutong, et al.
Pubblicazione: (2026)
TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents
di: Yu, Bihui, et al.
Pubblicazione: (2026)
di: Yu, Bihui, et al.
Pubblicazione: (2026)
Tool-MAD: A Multi-Agent Debate Framework for Fact Verification with Diverse Tool Augmentation and Adaptive Retrieval
di: Jeong, Seyeon, et al.
Pubblicazione: (2026)
di: Jeong, Seyeon, et al.
Pubblicazione: (2026)
MedOrch: Medical Diagnosis with Tool-Augmented Reasoning Agents for Flexible Extensibility
di: He, Yexiao, et al.
Pubblicazione: (2025)
di: He, Yexiao, et al.
Pubblicazione: (2025)
TableMind++: An Uncertainty-Aware Programmatic Agent for Tool-Augmented Table Reasoning
di: Cheng, Mingyue, et al.
Pubblicazione: (2026)
di: Cheng, Mingyue, et al.
Pubblicazione: (2026)
Pairing Analogy-Augmented Generation with Procedural Memory for Procedural Q&A
di: Roth, K, et al.
Pubblicazione: (2024)
di: Roth, K, et al.
Pubblicazione: (2024)
From Rows to Reasoning: A Retrieval-Augmented Multimodal Framework for Spreadsheet Understanding
di: Gulati, Anmol, et al.
Pubblicazione: (2026)
di: Gulati, Anmol, et al.
Pubblicazione: (2026)
T^2Agent A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree Search
di: Cui, Xing, et al.
Pubblicazione: (2025)
di: Cui, Xing, et al.
Pubblicazione: (2025)
Memory-Augmented Agent Training for Business Document Understanding
di: Liu, Jiale, et al.
Pubblicazione: (2024)
di: Liu, Jiale, et al.
Pubblicazione: (2024)
Evaluating Tool-Augmented Agents in Remote Sensing Platforms
di: Singh, Simranjit, et al.
Pubblicazione: (2024)
di: Singh, Simranjit, et al.
Pubblicazione: (2024)
Tool-Augmented Reward Modeling
di: Li, Lei, et al.
Pubblicazione: (2023)
di: Li, Lei, et al.
Pubblicazione: (2023)
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
di: Kim, Wonjoong, et al.
Pubblicazione: (2025)
di: Kim, Wonjoong, et al.
Pubblicazione: (2025)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
di: Li, Jiaang, et al.
Pubblicazione: (2025)
di: Li, Jiaang, et al.
Pubblicazione: (2025)
On the Role of Unobserved Sequences on Sample-based Uncertainty Quantification for LLMs
di: Kunitomo-Jacquin, Lucie, et al.
Pubblicazione: (2025)
di: Kunitomo-Jacquin, Lucie, et al.
Pubblicazione: (2025)
Order-Based Pre-training Strategies for Procedural Text Understanding
di: Nandy, Abhilash, et al.
Pubblicazione: (2024)
di: Nandy, Abhilash, et al.
Pubblicazione: (2024)
Tool-to-Agent Retrieval: Bridging Tools and Agents for Scalable LLM Multi-Agent Systems
di: Lumer, Elias, et al.
Pubblicazione: (2025)
di: Lumer, Elias, et al.
Pubblicazione: (2025)
TURA: Tool-Augmented Unified Retrieval Agent for AI Search
di: Zhao, Zhejun, et al.
Pubblicazione: (2025)
di: Zhao, Zhejun, et al.
Pubblicazione: (2025)
RAMA: Retrieval-Augmented Multi-Agent Framework for Misinformation Detection in Multimodal Fact-Checking
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
HM-RAG: Hierarchical Multi-Agent Multimodal Retrieval Augmented Generation
di: Liu, Pei, et al.
Pubblicazione: (2025)
di: Liu, Pei, et al.
Pubblicazione: (2025)
InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
di: Du, Yaxin, et al.
Pubblicazione: (2025)
di: Du, Yaxin, et al.
Pubblicazione: (2025)
Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning Agent
di: Li, Yangning, et al.
Pubblicazione: (2024)
di: Li, Yangning, et al.
Pubblicazione: (2024)
The Tool Illusion: Rethinking Tool Use in Web Agents
di: Lou, Renze, et al.
Pubblicazione: (2026)
di: Lou, Renze, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ProMQA: Question Answering Dataset for Multimodal Procedural Activity Understanding
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2024) -
A Video-grounded Dialogue Dataset and Metric for Event-driven Activities
di: Imrattanatrai, Wiradee, et al.
Pubblicazione: (2025) -
ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2025) -
Formulation Comparison for Timeline Construction using LLMs
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2024) -
Scaling Multi-Document Event Summarization: Evaluating Compression vs. Full-Text Approaches
di: Pratapa, Adithya, et al.
Pubblicazione: (2025)