MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Shoubin, Zhang, Yue, Wang, Ziyang, Yoon, Jaehong, Bansal, Mohit |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
par: Yu, Shoubin, et autres
Publié: (2024)
par: Yu, Shoubin, et autres
Publié: (2024)
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
par: Yoon, Jaehong, et autres
Publié: (2024)
par: Yoon, Jaehong, et autres
Publié: (2024)
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
par: Wang, Ziyang, et autres
Publié: (2025)
par: Wang, Ziyang, et autres
Publié: (2025)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
par: Li, Jialu, et autres
Publié: (2025)
par: Li, Jialu, et autres
Publié: (2025)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
par: Wang, Ziyang, et autres
Publié: (2026)
par: Wang, Ziyang, et autres
Publié: (2026)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
par: Wang, Ziyang, et autres
Publié: (2024)
par: Wang, Ziyang, et autres
Publié: (2024)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
Hierarchy-Aware Multimodal Unlearning for Medical AI
par: Wu, Fengli, et autres
Publié: (2025)
par: Wu, Fengli, et autres
Publié: (2025)
DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
par: Sivakumaran, Nithin, et autres
Publié: (2025)
par: Sivakumaran, Nithin, et autres
Publié: (2025)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
par: Lee, Daeun, et autres
Publié: (2024)
par: Lee, Daeun, et autres
Publié: (2024)
SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
par: Yoon, Jaehong, et autres
Publié: (2024)
par: Yoon, Jaehong, et autres
Publié: (2024)
SELMA: Learning and Merging Skill-Specific Text-to-Image Experts with Auto-Generated Data
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation
par: Wang, Zun, et autres
Publié: (2024)
par: Wang, Zun, et autres
Publié: (2024)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
par: Lee, Daeun, et autres
Publié: (2026)
par: Lee, Daeun, et autres
Publié: (2026)
ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models
par: Sung, Yi-Lin, et autres
Publié: (2023)
par: Sung, Yi-Lin, et autres
Publié: (2023)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
Planning with Sketch-Guided Verification for Physics-Aware Video Generation
par: Huang, Yidong, et autres
Publié: (2025)
par: Huang, Yidong, et autres
Publié: (2025)
Multimodal Fact-Level Attribution for Verifiable Reasoning
par: Wan, David, et autres
Publié: (2026)
par: Wan, David, et autres
Publié: (2026)
AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
par: Wang, Zun, et autres
Publié: (2026)
par: Wang, Zun, et autres
Publié: (2026)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
par: Yeo, Woongyeong, et autres
Publié: (2025)
par: Yeo, Woongyeong, et autres
Publié: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
par: Deng, Andong, et autres
Publié: (2025)
par: Deng, Andong, et autres
Publié: (2025)
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
par: Yue, Xiang, et autres
Publié: (2023)
par: Yue, Xiang, et autres
Publié: (2023)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance
par: Wang, Zun, et autres
Publié: (2025)
par: Wang, Zun, et autres
Publié: (2025)
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
par: Niu, Tianyi, et autres
Publié: (2025)
par: Niu, Tianyi, et autres
Publié: (2025)
Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering
par: Frahm, Noah, et autres
Publié: (2025)
par: Frahm, Noah, et autres
Publié: (2025)
CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
par: Pothiraj, Atin, et autres
Publié: (2025)
par: Pothiraj, Atin, et autres
Publié: (2025)
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
par: Wang, Zun, et autres
Publié: (2024)
par: Wang, Zun, et autres
Publié: (2024)
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
STAR: A Benchmark for Situated Reasoning in Real-World Videos
par: Wu, Bo, et autres
Publié: (2024)
par: Wu, Bo, et autres
Publié: (2024)
Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
par: Lin, Han, et autres
Publié: (2025)
par: Lin, Han, et autres
Publié: (2025)
M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding
par: Cho, Jaemin, et autres
Publié: (2024)
par: Cho, Jaemin, et autres
Publié: (2024)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
par: Zhang, Yue, et autres
Publié: (2026)
par: Zhang, Yue, et autres
Publié: (2026)
PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation
par: Huang, Yidong, et autres
Publié: (2026)
par: Huang, Yidong, et autres
Publié: (2026)
Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation
par: Patil, Vaidehi, et autres
Publié: (2025)
par: Patil, Vaidehi, et autres
Publié: (2025)
VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
par: Lin, Han, et autres
Publié: (2023)
par: Lin, Han, et autres
Publié: (2023)
Documents similaires
-
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
par: Yu, Shoubin, et autres
Publié: (2024) -
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
par: Yoon, Jaehong, et autres
Publié: (2024) -
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
par: Wang, Ziyang, et autres
Publié: (2025) -
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
par: Li, Jialu, et autres
Publié: (2025) -
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
par: Wang, Ziyang, et autres
Publié: (2026)