Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shi, Min, Liu, Fuxiao, Wang, Shihao, Liao, Shijia, Radhakrishnan, Subhashree, Zhao, Yilin, Huang, De-An, Yin, Hongxu, Sapra, Karan, Yacoob, Yaser, Shi, Humphrey, Catanzaro, Bryan, Tao, Andrew, Kautz, Jan, Yu, Zhiding, Liu, Guilin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LITA: Language Instructed Temporal-Localization Assistant
par: Huang, De-An, et autres
Publié: (2024)
par: Huang, De-An, et autres
Publié: (2024)
AIDE: Agentically Improve Visual Language Model with Domain Experts
par: Chiu, Ming-Chang, et autres
Publié: (2025)
par: Chiu, Ming-Chang, et autres
Publié: (2025)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
par: Huang, De-An, et autres
Publié: (2025)
par: Huang, De-An, et autres
Publié: (2025)
Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models
par: Li, Zhiqi, et autres
Publié: (2025)
par: Li, Zhiqi, et autres
Publié: (2025)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023)
par: Liu, Fuxiao, et autres
Publié: (2023)
MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023)
par: Liu, Fuxiao, et autres
Publié: (2023)
PhyCritic: Multimodal Critic Models for Physical AI
par: Xiong, Tianyi, et autres
Publié: (2026)
par: Xiong, Tianyi, et autres
Publié: (2026)
Stateful Token Reduction for Long-Video Hybrid VLMs
par: Jiang, Jindong, et autres
Publié: (2026)
par: Jiang, Jindong, et autres
Publié: (2026)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
par: Shi, Min, et autres
Publié: (2025)
par: Shi, Min, et autres
Publié: (2025)
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning
par: Zhang, Shaokun, et autres
Publié: (2025)
par: Zhang, Shaokun, et autres
Publié: (2025)
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
par: Chen, Guo, et autres
Publié: (2025)
par: Chen, Guo, et autres
Publié: (2025)
OMCAT: Omni Context Aware Transformer
par: Goel, Arushi, et autres
Publié: (2024)
par: Goel, Arushi, et autres
Publié: (2024)
Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline
par: Chen, Guo, et autres
Publié: (2026)
par: Chen, Guo, et autres
Publié: (2026)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
par: Jiang, Jindong, et autres
Publié: (2025)
par: Jiang, Jindong, et autres
Publié: (2025)
Mitigating Hallucinations in Diffusion Models through Adaptive Attention Modulation
par: Oorloff, Trevine, et autres
Publié: (2025)
par: Oorloff, Trevine, et autres
Publié: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
par: Heinrich, Greg, et autres
Publié: (2024)
par: Heinrich, Greg, et autres
Publié: (2024)
Beyond the Binary
par: Yacoob, Saadia
Publié: (2024)
par: Yacoob, Saadia
Publié: (2024)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
par: Lin, Sheng-Chieh, et autres
Publié: (2024)
par: Lin, Sheng-Chieh, et autres
Publié: (2024)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
par: Guan, Tianrui, et autres
Publié: (2023)
par: Guan, Tianrui, et autres
Publié: (2023)
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
par: Jain, Jitesh, et autres
Publié: (2024)
par: Jain, Jitesh, et autres
Publié: (2024)
3D Aware Region Prompted Vision Language Model
par: Cheng, An-Chieh, et autres
Publié: (2025)
par: Cheng, An-Chieh, et autres
Publié: (2025)
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
par: Wang, Shihao, et autres
Publié: (2026)
par: Wang, Shihao, et autres
Publié: (2026)
Exposure of taste buds to potassium permanganate and formalin suppresses the gustatory neural response in the Nile tilapia Oreochromis niloticus (Linnaeus) / Syed Yahiya Yacoob
par: Yahiya Yacoob, Syed
Publié: (2002)
par: Yahiya Yacoob, Syed
Publié: (2002)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
par: Azadani, Mozhgan Nasr, et autres
Publié: (2025)
par: Azadani, Mozhgan Nasr, et autres
Publié: (2025)
What is Point Supervision Worth in Video Instance Segmentation?
par: Huang, Shuaiyi, et autres
Publié: (2024)
par: Huang, Shuaiyi, et autres
Publié: (2024)
3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing
par: Zhen, Haoyu, et autres
Publié: (2026)
par: Zhen, Haoyu, et autres
Publié: (2026)
NVLM: Open Frontier-Class Multimodal LLMs
par: Dai, Wenliang, et autres
Publié: (2024)
par: Dai, Wenliang, et autres
Publié: (2024)
Le-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder Design
par: Huang, Jiannan, et autres
Publié: (2026)
par: Huang, Jiannan, et autres
Publié: (2026)
OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation
par: Zhang, Letian, et autres
Publié: (2026)
par: Zhang, Letian, et autres
Publié: (2026)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
par: Wang, Shihao, et autres
Publié: (2024)
par: Wang, Shihao, et autres
Publié: (2024)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
par: Man, Yunze, et autres
Publié: (2025)
par: Man, Yunze, et autres
Publié: (2025)
DeepFM-Crispr: Prediction of CRISPR On-Target Effects via Deep Learning
par: Bao, Condy, et autres
Publié: (2024)
par: Bao, Condy, et autres
Publié: (2024)
StreamChat: Chatting with Streaming Video
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
FeatSharp: Your Vision Model Features, Sharper
par: Ranzinger, Mike, et autres
Publié: (2025)
par: Ranzinger, Mike, et autres
Publié: (2025)
CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts
par: Li, Jiachen, et autres
Publié: (2024)
par: Li, Jiachen, et autres
Publié: (2024)
TradExpert: Revolutionizing Trading with Mixture of Expert LLMs
par: Ding, Qianggang, et autres
Publié: (2024)
par: Ding, Qianggang, et autres
Publié: (2024)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
par: Zhang, Wenyu, et autres
Publié: (2024)
par: Zhang, Wenyu, et autres
Publié: (2024)
RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models
par: Huang, Jie, et autres
Publié: (2023)
par: Huang, Jie, et autres
Publié: (2023)
Documents similaires
-
LITA: Language Instructed Temporal-Localization Assistant
par: Huang, De-An, et autres
Publié: (2024) -
AIDE: Agentically Improve Visual Language Model with Domain Experts
par: Chiu, Ming-Chang, et autres
Publié: (2025) -
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
par: Huang, De-An, et autres
Publié: (2025) -
Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models
par: Li, Zhiqi, et autres
Publié: (2025) -
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023)