PALO: A Polyglot Large Multimodal Model for 5B People
Fuente:
arXiv
Guardado en:
| Autores principales: | Maaz, Muhammad, Rasheed, Hanoona, Shaker, Abdelrahman, Khan, Salman, Cholakal, Hisham, Anwer, Rao M., Baldwin, Tim, Felsberg, Michael, Khan, Fahad S. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GLaMM: Pixel Grounding Large Multimodal Model
por: Rasheed, Hanoona, et al.
Publicado: (2023)
por: Rasheed, Hanoona, et al.
Publicado: (2023)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
por: Maaz, Muhammad, et al.
Publicado: (2025)
por: Maaz, Muhammad, et al.
Publicado: (2025)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
por: Maaz, Muhammad, et al.
Publicado: (2024)
por: Maaz, Muhammad, et al.
Publicado: (2024)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
por: Maaz, Muhammad, et al.
Publicado: (2023)
por: Maaz, Muhammad, et al.
Publicado: (2023)
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
por: Shaker, Abdelrahman, et al.
Publicado: (2022)
por: Shaker, Abdelrahman, et al.
Publicado: (2022)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
por: Rasheed, Hanoona, et al.
Publicado: (2025)
por: Rasheed, Hanoona, et al.
Publicado: (2025)
MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT
por: Thawakar, Omkar, et al.
Publicado: (2024)
por: Thawakar, Omkar, et al.
Publicado: (2024)
EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
por: Thawakar, Omkar, et al.
Publicado: (2025)
por: Thawakar, Omkar, et al.
Publicado: (2025)
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
por: Rasheed, Hanoona, et al.
Publicado: (2025)
por: Rasheed, Hanoona, et al.
Publicado: (2025)
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
por: Ishaq, Ayesha, et al.
Publicado: (2025)
por: Ishaq, Ayesha, et al.
Publicado: (2025)
AIN: The Arabic INclusive Large Multimodal Model
por: Heakl, Ahmed, et al.
Publicado: (2025)
por: Heakl, Ahmed, et al.
Publicado: (2025)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
por: Ashraf, Tajamul, et al.
Publicado: (2025)
por: Ashraf, Tajamul, et al.
Publicado: (2025)
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
por: Shaker, Abdelrahman, et al.
Publicado: (2025)
por: Shaker, Abdelrahman, et al.
Publicado: (2025)
XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models
por: Thawakar, Omkar, et al.
Publicado: (2023)
por: Thawakar, Omkar, et al.
Publicado: (2023)
CDChat: A Large Multimodal Model for Remote Sensing Change Description
por: Noman, Mubashir, et al.
Publicado: (2024)
por: Noman, Mubashir, et al.
Publicado: (2024)
BiMediX: Bilingual Medical Mixture of Experts LLM
por: Pieri, Sara, et al.
Publicado: (2024)
por: Pieri, Sara, et al.
Publicado: (2024)
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
por: Thawakar, Omkar, et al.
Publicado: (2024)
por: Thawakar, Omkar, et al.
Publicado: (2024)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
por: Kumar, Komal, et al.
Publicado: (2025)
por: Kumar, Komal, et al.
Publicado: (2025)
AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock
por: Nawaz, Umair, et al.
Publicado: (2025)
por: Nawaz, Umair, et al.
Publicado: (2025)
MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
por: Sheikh, Tooba Tehreem, et al.
Publicado: (2025)
por: Sheikh, Tooba Tehreem, et al.
Publicado: (2025)
WorldCache: Content-Aware Caching for Accelerated Video World Models
por: Nawaz, Umair, et al.
Publicado: (2026)
por: Nawaz, Umair, et al.
Publicado: (2026)
Learnable Weight Initialization for Volumetric Medical Image Segmentation
por: Kunhimon, Shahina, et al.
Publicado: (2023)
por: Kunhimon, Shahina, et al.
Publicado: (2023)
GroupMamba: Efficient Group-Based Visual State Space Model
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
MAviS: A Multimodal Conversational Assistant For Avian Species
por: Kryklyvets, Yevheniia, et al.
Publicado: (2026)
por: Kryklyvets, Yevheniia, et al.
Publicado: (2026)
Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
por: Boudjoghra, Mohamed El Amine, et al.
Publicado: (2024)
por: Boudjoghra, Mohamed El Amine, et al.
Publicado: (2024)
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
por: Luo, Ziyang, et al.
Publicado: (2025)
por: Luo, Ziyang, et al.
Publicado: (2025)
Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device
por: Shaker, Abdelrahman, et al.
Publicado: (2026)
por: Shaker, Abdelrahman, et al.
Publicado: (2026)
LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM
por: Shikhar, Sambal, et al.
Publicado: (2025)
por: Shikhar, Sambal, et al.
Publicado: (2025)
Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking
por: Ishaq, Ayesha, et al.
Publicado: (2024)
por: Ishaq, Ayesha, et al.
Publicado: (2024)
Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning
por: Kumar, Amandeep, et al.
Publicado: (2024)
por: Kumar, Amandeep, et al.
Publicado: (2024)
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
por: Kumar, Komal, et al.
Publicado: (2025)
por: Kumar, Komal, et al.
Publicado: (2025)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
por: Nawaz, Umair, et al.
Publicado: (2024)
por: Nawaz, Umair, et al.
Publicado: (2024)
Multi-modal Generation via Cross-Modal In-Context Learning
por: Kumar, Amandeep, et al.
Publicado: (2024)
por: Kumar, Amandeep, et al.
Publicado: (2024)
BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning
por: Hanif, Asif, et al.
Publicado: (2024)
por: Hanif, Asif, et al.
Publicado: (2024)
ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark
por: Ghaboura, Sara, et al.
Publicado: (2025)
por: Ghaboura, Sara, et al.
Publicado: (2025)
MediX-R1: Open Ended Medical Reinforcement Learning
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2026)
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2026)
Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery
por: Noman, Mubashir, et al.
Publicado: (2024)
por: Noman, Mubashir, et al.
Publicado: (2024)
Semi-supervised Open-World Object Detection
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2024)
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2024)
Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts
por: Ghaboura, Sara, et al.
Publicado: (2025)
por: Ghaboura, Sara, et al.
Publicado: (2025)
Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos
por: Ding, Bonan, et al.
Publicado: (2026)
por: Ding, Bonan, et al.
Publicado: (2026)
Ejemplares similares
-
GLaMM: Pixel Grounding Large Multimodal Model
por: Rasheed, Hanoona, et al.
Publicado: (2023) -
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
por: Maaz, Muhammad, et al.
Publicado: (2025) -
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
por: Maaz, Muhammad, et al.
Publicado: (2024) -
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
por: Maaz, Muhammad, et al.
Publicado: (2023) -
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
por: Shaker, Abdelrahman, et al.
Publicado: (2022)