MMTB: Evaluating Terminal Agents on Multimedia-File Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Heo, Chiyeong, Kim, Jaechang, Kwon, Junhyuk, Kim, Hoyoung, Park, Dongmin, Lee, Jonghyun, Ok, Jungseul |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Semantic Exploration with Adaptive Gating for Efficient Problem Solving with Language Models
by: Lee, Sungjae, et al.
Published: (2025)
by: Lee, Sungjae, et al.
Published: (2025)
Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
by: Nguyen, Truong Thanh Hung, et al.
Published: (2026)
by: Nguyen, Truong Thanh Hung, et al.
Published: (2026)
VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension
by: Park, Hyejin, et al.
Published: (2026)
by: Park, Hyejin, et al.
Published: (2026)
ProCompNav: Proactive Instance Navigation with Comparative Judgment for Ambiguous User Queries
by: Kwon, Junhyuk, et al.
Published: (2026)
by: Kwon, Junhyuk, et al.
Published: (2026)
Efficient Latent Semantic Clustering for Scaling Test-Time Computation of LLMs
by: Lee, Sungjae, et al.
Published: (2025)
by: Lee, Sungjae, et al.
Published: (2025)
Bridging the Gap between Expert and Language Models: Concept-guided Chess Commentary Generation and Evaluation
by: Kim, Jaechang, et al.
Published: (2024)
by: Kim, Jaechang, et al.
Published: (2024)
FairStream: Fair Multimedia Streaming Benchmark for Reinforcement Learning Agents
by: Weil, Jannis, et al.
Published: (2024)
by: Weil, Jannis, et al.
Published: (2024)
Making Models Unmergeable via Scaling-Sensitive Loss Landscape
by: Jang, Minwoo, et al.
Published: (2026)
by: Jang, Minwoo, et al.
Published: (2026)
D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation From Lead sheet
by: Choi, Eunjin, et al.
Published: (2026)
by: Choi, Eunjin, et al.
Published: (2026)
SynthGuard: An Open Platform for Detecting AI-Generated Multimedia with Multimodal LLMs
by: Desai, Shail, et al.
Published: (2025)
by: Desai, Shail, et al.
Published: (2025)
Large Language Model Based Multi-Agent System Augmented Complex Event Processing Pipeline for Internet of Multimedia Things
by: Zeeshan, Talha, et al.
Published: (2025)
by: Zeeshan, Talha, et al.
Published: (2025)
Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences
by: Koo, Jabin, et al.
Published: (2026)
by: Koo, Jabin, et al.
Published: (2026)
Detecting Multimedia Generated by Large AI Models: A Survey
by: Lin, Li, et al.
Published: (2024)
by: Lin, Li, et al.
Published: (2024)
Back to Basics: Revisiting ASR in the Age of Voice Agents
by: Tay, Geeyang, et al.
Published: (2026)
by: Tay, Geeyang, et al.
Published: (2026)
Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios
by: Wang, Bing, et al.
Published: (2026)
by: Wang, Bing, et al.
Published: (2026)
A review on Machine Learning based User-Centric Multimedia Streaming Techniques
by: Ghosh, Monalisa, et al.
Published: (2024)
by: Ghosh, Monalisa, et al.
Published: (2024)
A Multimedia Analytics Model for the Foundation Model Era
by: Worring, Marcel, et al.
Published: (2025)
by: Worring, Marcel, et al.
Published: (2025)
Learning What To Hear: Boosting Sound-Source Association For Robust Audiovisual Instance Segmentation
by: Seo, Jinbae, et al.
Published: (2025)
by: Seo, Jinbae, et al.
Published: (2025)
Sensorium Arc: AI Agent System for Oceanic Data Exploration and Interactive Eco-Art
by: Bissell, Noah, et al.
Published: (2025)
by: Bissell, Noah, et al.
Published: (2025)
EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning
by: Kim, Jongsuk, et al.
Published: (2024)
by: Kim, Jongsuk, et al.
Published: (2024)
Stage-Adaptive Reliability Modeling for Continuous Valence-Arousal Estimation
by: Lee, Yubeen, et al.
Published: (2026)
by: Lee, Yubeen, et al.
Published: (2026)
Solving Copyright Infringement on Short Video Platforms: Novel Datasets and an Audio Restoration Deep Learning Pipeline
by: Oh, Minwoo, et al.
Published: (2025)
by: Oh, Minwoo, et al.
Published: (2025)
Music Arena: Live Evaluation for Text-to-Music
by: Kim, Yonghyun, et al.
Published: (2025)
by: Kim, Yonghyun, et al.
Published: (2025)
Active Prompt Learning with Vision-Language Model Priors
by: Kim, Hoyoung, et al.
Published: (2024)
by: Kim, Hoyoung, et al.
Published: (2024)
A Rhetorical Relations-Based Framework for Tailored Multimedia Document Summarization
by: Maredj, Azze-Eddine, et al.
Published: (2024)
by: Maredj, Azze-Eddine, et al.
Published: (2024)
SAFIRE: Segment Any Forged Image Region
by: Kwon, Myung-Joon, et al.
Published: (2024)
by: Kwon, Myung-Joon, et al.
Published: (2024)
HiQuE: Hierarchical Question Embedding Network for Multimodal Depression Detection
by: Jung, Juho, et al.
Published: (2024)
by: Jung, Juho, et al.
Published: (2024)
Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation
by: Kim, Wongyu, et al.
Published: (2025)
by: Kim, Wongyu, et al.
Published: (2025)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
by: Park, Kyu Ri, et al.
Published: (2024)
by: Park, Kyu Ri, et al.
Published: (2024)
LUST: A Multi-Modal Framework with Hierarchical LLM-based Scoring for Learned Thematic Significance Tracking in Multimedia Content
by: Luiz, Anderson de Lima
Published: (2025)
by: Luiz, Anderson de Lima
Published: (2025)
Real-Time Mobile Video Analytics for Pre-arrival Emergency Medical Services
by: Jin, Liuyi, et al.
Published: (2025)
by: Jin, Liuyi, et al.
Published: (2025)
Machine Learning-Driven Open-Source Framework for Assessing QoE in Multimedia Networks
by: Panahi, Parsa Hassani Shariat, et al.
Published: (2024)
by: Panahi, Parsa Hassani Shariat, et al.
Published: (2024)
Activity-Guided Industrial Anomalous Sound Detection against Interferences
by: Lee, Yunjoo, et al.
Published: (2024)
by: Lee, Yunjoo, et al.
Published: (2024)
AniME: Adaptive Multi-Agent Planning for Long Animation Generation
by: Zhang, Lisai, et al.
Published: (2025)
by: Zhang, Lisai, et al.
Published: (2025)
Multi-Agent Game Generation and Evaluation via Audio-Visual Recordings
by: Jolicoeur-Martineau, Alexia
Published: (2025)
by: Jolicoeur-Martineau, Alexia
Published: (2025)
Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs
by: Chen, Jianhao, et al.
Published: (2026)
by: Chen, Jianhao, et al.
Published: (2026)
Diversify, Contextualize, and Adapt: Efficient Entropy Modeling for Neural Image Codec
by: Kim, Jun-Hyuk, et al.
Published: (2024)
by: Kim, Jun-Hyuk, et al.
Published: (2024)
Wireless Video Semantic Communication with Decoupled Diffusion Multi-frame Compensation
by: Xie, Bingyan, et al.
Published: (2025)
by: Xie, Bingyan, et al.
Published: (2025)
Visual Prompt Discovery via Semantic Exploration
by: Kim, Jaechang, et al.
Published: (2026)
by: Kim, Jaechang, et al.
Published: (2026)
Iterative Residual Cross-Attention Mechanism: An Integrated Approach for Audio-Visual Navigation Tasks
by: Zhang, Hailong, et al.
Published: (2025)
by: Zhang, Hailong, et al.
Published: (2025)
Similar Items
-
Semantic Exploration with Adaptive Gating for Efficient Problem Solving with Language Models
by: Lee, Sungjae, et al.
Published: (2025) -
Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
by: Nguyen, Truong Thanh Hung, et al.
Published: (2026) -
VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension
by: Park, Hyejin, et al.
Published: (2026) -
ProCompNav: Proactive Instance Navigation with Comparative Judgment for Ambiguous User Queries
by: Kwon, Junhyuk, et al.
Published: (2026) -
Efficient Latent Semantic Clustering for Scaling Test-Time Computation of LLMs
by: Lee, Sungjae, et al.
Published: (2025)