A Culturally-diverse Multilingual Multimodal Video Benchmark & Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Shafique, Bhuiyan Sanjid, Vayani, Ashmal, Maaz, Muhammad, Rasheed, Hanoona Abdul, Dissanayake, Dinura, Kurpath, Mohammed Irfan, Hmaiti, Yahya, Inoue, Go, Lahoud, Jean, Rashid, Md. Safirur, Quasem, Shadid Intisar, Fatima, Maheen, Vidal, Franco, Maslych, Mykola, More, Ketan Pravin, Baliah, Sanoojan, Watawana, Hasindri, Li, Yuhao, Farestam, Fabian, Schaller, Leon, Tymtsiv, Roman, Weber, Simon, Cholakkal, Hisham, Laptev, Ivan, Satoh, Shin'ichi, Felsberg, Michael, Shah, Mubarak, Khan, Salman, Khan, Fahad Shahbaz |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
di: Dissanayake, Dinura, et al.
Pubblicazione: (2025)
di: Dissanayake, Dinura, et al.
Pubblicazione: (2025)
DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
di: Ishaq, Ayesha, et al.
Pubblicazione: (2025)
di: Ishaq, Ayesha, et al.
Pubblicazione: (2025)
Towards Generalizing to Unseen Domains with Few Labels
di: Galappaththige, Chamuditha Jayanga, et al.
Pubblicazione: (2024)
di: Galappaththige, Chamuditha Jayanga, et al.
Pubblicazione: (2024)
O-TPT: Orthogonality Constraints for Calibrating Test-time Prompt Tuning in Vision-Language Models
di: Sharifdeen, Ashshak, et al.
Pubblicazione: (2025)
di: Sharifdeen, Ashshak, et al.
Pubblicazione: (2025)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024)
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
Realistic and Efficient Face Swapping: A Unified Approach with Diffusion Models
di: Baliah, Sanoojan, et al.
Pubblicazione: (2024)
di: Baliah, Sanoojan, et al.
Pubblicazione: (2024)
LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM
di: Shikhar, Sambal, et al.
Pubblicazione: (2025)
di: Shikhar, Sambal, et al.
Pubblicazione: (2025)
LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs
di: Thawakar, Omkar, et al.
Pubblicazione: (2025)
di: Thawakar, Omkar, et al.
Pubblicazione: (2025)
VFace: A Training-Free Approach for Diffusion-Based Video Face Swapping
di: Baliah, Sanoojan, et al.
Pubblicazione: (2026)
di: Baliah, Sanoojan, et al.
Pubblicazione: (2026)
MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT
di: Thawakar, Omkar, et al.
Pubblicazione: (2024)
di: Thawakar, Omkar, et al.
Pubblicazione: (2024)
Synergistic Neural Forecasting of Air Pollution with Stochastic Sampling
di: Abeysinghe, Yohan, et al.
Pubblicazione: (2025)
di: Abeysinghe, Yohan, et al.
Pubblicazione: (2025)
All Languages Matter: Evaluating LMMs on Culturally Diverse 100 Languages
di: Vayani, Ashmal, et al.
Pubblicazione: (2024)
di: Vayani, Ashmal, et al.
Pubblicazione: (2024)
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
di: Ishaq, Ayesha, et al.
Pubblicazione: (2025)
di: Ishaq, Ayesha, et al.
Pubblicazione: (2025)
PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal Model
di: Kareem, Amrin, et al.
Pubblicazione: (2024)
di: Kareem, Amrin, et al.
Pubblicazione: (2024)
MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
di: Sheikh, Tooba Tehreem, et al.
Pubblicazione: (2025)
di: Sheikh, Tooba Tehreem, et al.
Pubblicazione: (2025)
MediX-R1: Open Ended Medical Reinforcement Learning
di: Mullappilly, Sahal Shaji, et al.
Pubblicazione: (2026)
di: Mullappilly, Sahal Shaji, et al.
Pubblicazione: (2026)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
di: Kumar, Komal, et al.
Pubblicazione: (2025)
di: Kumar, Komal, et al.
Pubblicazione: (2025)
BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models
di: Narnaware, Vishal, et al.
Pubblicazione: (2025)
di: Narnaware, Vishal, et al.
Pubblicazione: (2025)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
MAviS: A Multimodal Conversational Assistant For Avian Species
di: Kryklyvets, Yevheniia, et al.
Pubblicazione: (2026)
di: Kryklyvets, Yevheniia, et al.
Pubblicazione: (2026)
BiMediX2: Bio-Medical EXpert LMM for Diverse Medical Modalities
di: Mullappilly, Sahal Shaji, et al.
Pubblicazione: (2024)
di: Mullappilly, Sahal Shaji, et al.
Pubblicazione: (2024)
PALO: A Polyglot Large Multimodal Model for 5B People
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
MedRoute: RL-Based Dynamic Specialist Routing in Multi-Agent Medical Diagnosis
di: Vayani, Ashmal, et al.
Pubblicazione: (2026)
di: Vayani, Ashmal, et al.
Pubblicazione: (2026)
Learning to Share: Selective Memory for Efficient Parallel Agentic Systems
di: Fioresi, Joseph, et al.
Pubblicazione: (2026)
di: Fioresi, Joseph, et al.
Pubblicazione: (2026)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
di: Boudjoghra, Mohamed El Amine, et al.
Pubblicazione: (2024)
di: Boudjoghra, Mohamed El Amine, et al.
Pubblicazione: (2024)
Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking
di: Ishaq, Ayesha, et al.
Pubblicazione: (2024)
di: Ishaq, Ayesha, et al.
Pubblicazione: (2024)
Towards Deeper Understanding of Natural User Interactions in Virtual Reality Based Assembly Tasks
di: Ghamandi, Ryan, et al.
Pubblicazione: (2025)
di: Ghamandi, Ryan, et al.
Pubblicazione: (2025)
CLIMB-3D: Continual Learning for Imbalanced 3D Instance Segmentation
di: Thengane, Vishal, et al.
Pubblicazione: (2025)
di: Thengane, Vishal, et al.
Pubblicazione: (2025)
Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models
di: Saeed, Muhammed, et al.
Pubblicazione: (2025)
di: Saeed, Muhammed, et al.
Pubblicazione: (2025)
A Benchmark and Agentic Framework for Omni-Modal Reasoning and Tool Use in Long Videos
di: Kurpath, Mohammed Irfan, et al.
Pubblicazione: (2025)
di: Kurpath, Mohammed Irfan, et al.
Pubblicazione: (2025)
GLaMM: Pixel Grounding Large Multimodal Model
di: Rasheed, Hanoona, et al.
Pubblicazione: (2023)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2023)
XR-First Design for Productivity: A Conceptual Framework for Enabling Efficient Task Switching in XR
di: Gottsacker, Matt, et al.
Pubblicazione: (2025)
di: Gottsacker, Matt, et al.
Pubblicazione: (2025)
Uncertainty Awareness Enables Efficient Labeling for Cancer Subtyping in Digital Pathology
di: Sivaroopan, Nirhoshan, et al.
Pubblicazione: (2025)
di: Sivaroopan, Nirhoshan, et al.
Pubblicazione: (2025)
Unattainability of Common Knowledge in Asymmetric Games with Imperfect Information
di: Farestam, Fabian, et al.
Pubblicazione: (2025)
di: Farestam, Fabian, et al.
Pubblicazione: (2025)
GAEA: A Geolocation Aware Conversational Assistant
di: Campos, Ron, et al.
Pubblicazione: (2025)
di: Campos, Ron, et al.
Pubblicazione: (2025)
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2022)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2022)
Documenti analoghi
-
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
di: Dissanayake, Dinura, et al.
Pubblicazione: (2025) -
DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
di: Ishaq, Ayesha, et al.
Pubblicazione: (2025) -
Towards Generalizing to Unseen Domains with Few Labels
di: Galappaththige, Chamuditha Jayanga, et al.
Pubblicazione: (2024) -
O-TPT: Orthogonality Constraints for Calibrating Test-time Prompt Tuning in Vision-Language Models
di: Sharifdeen, Ashshak, et al.
Pubblicazione: (2025) -
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024)