MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention
Fuente:
arXiv
Salvato in:
| Autori principali: | Pang, Yuqi, Yang, Bowen, Cao, Yun, Fan, Rong, Li, Xiaoyu, He, Chen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoCHA: Denoising Caption Supervision for Motion-Text Retrieval
di: Warner, Nikolai, et al.
Pubblicazione: (2026)
di: Warner, Nikolai, et al.
Pubblicazione: (2026)
MoCHA-former: Moiré-Conditioned Hybrid Adaptive Transformer for Video Demoiréing
di: Sung, Jeahun, et al.
Pubblicazione: (2025)
di: Sung, Jeahun, et al.
Pubblicazione: (2025)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
di: Lin, Bin, et al.
Pubblicazione: (2024)
di: Lin, Bin, et al.
Pubblicazione: (2024)
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
di: Kong, Lingshun, et al.
Pubblicazione: (2026)
di: Kong, Lingshun, et al.
Pubblicazione: (2026)
CBDES MoE: Hierarchically Decoupled Mixture-of-Experts for Functional Modules in Autonomous Driving
di: Xiang, Qi, et al.
Pubblicazione: (2025)
di: Xiang, Qi, et al.
Pubblicazione: (2025)
Fair-MoE: Fairness-Oriented Mixture of Experts in Vision-Language Models
di: Wang, Peiran, et al.
Pubblicazione: (2025)
di: Wang, Peiran, et al.
Pubblicazione: (2025)
ChartMoE: Mixture of Diversely Aligned Expert Connector for Chart Understanding
di: Xu, Zhengzhuo, et al.
Pubblicazione: (2024)
di: Xu, Zhengzhuo, et al.
Pubblicazione: (2024)
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
di: Qin, Guangshuo, et al.
Pubblicazione: (2026)
di: Qin, Guangshuo, et al.
Pubblicazione: (2026)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
di: Pang, Yuqi, et al.
Pubblicazione: (2025)
di: Pang, Yuqi, et al.
Pubblicazione: (2025)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
Uni-Med: A Unified Medical Generalist Foundation Model For Multi-Task Learning Via Connector-MoE
di: Zhu, Xun, et al.
Pubblicazione: (2024)
di: Zhu, Xun, et al.
Pubblicazione: (2024)
Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
di: Zheng, Youwei, et al.
Pubblicazione: (2025)
di: Zheng, Youwei, et al.
Pubblicazione: (2025)
BIG-MoE: Bypass Isolated Gating MoE for Generalized Multimodal Face Anti-Spoofing
di: Ma, Yingjie, et al.
Pubblicazione: (2024)
di: Ma, Yingjie, et al.
Pubblicazione: (2024)
MoE-GS: Mixture of Experts for Dynamic Gaussian Splatting
di: Jin, In-Hwan, et al.
Pubblicazione: (2025)
di: Jin, In-Hwan, et al.
Pubblicazione: (2025)
MoETTA: Test-Time Adaptation Under Mixed Distribution Shifts with MoE-LayerNorm
di: Fan, Xiao, et al.
Pubblicazione: (2025)
di: Fan, Xiao, et al.
Pubblicazione: (2025)
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
di: Ko, Dohwan, et al.
Pubblicazione: (2026)
di: Ko, Dohwan, et al.
Pubblicazione: (2026)
GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE Transformer
di: Zhao, Xinyuan, et al.
Pubblicazione: (2026)
di: Zhao, Xinyuan, et al.
Pubblicazione: (2026)
Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
di: Xu, Yu, et al.
Pubblicazione: (2026)
di: Xu, Yu, et al.
Pubblicazione: (2026)
Nucleus-Image: Sparse MoE for Image Generation
di: Akiti, Chandan, et al.
Pubblicazione: (2026)
di: Akiti, Chandan, et al.
Pubblicazione: (2026)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
di: Shu, Fangxun, et al.
Pubblicazione: (2024)
When Does Sparse MoE Help in Vision? The Role of Backbone Compute Leverage in Sparse Routing
di: Sun, Libo, et al.
Pubblicazione: (2026)
di: Sun, Libo, et al.
Pubblicazione: (2026)
LongScape: Advancing Long-Horizon Embodied World Models with Context-Aware MoE
di: Shang, Yu, et al.
Pubblicazione: (2025)
di: Shang, Yu, et al.
Pubblicazione: (2025)
MoE3D: A Mixture-of-Experts Module for 3D Reconstruction
di: Wang, Zichen, et al.
Pubblicazione: (2026)
di: Wang, Zichen, et al.
Pubblicazione: (2026)
eMoE-Tracker: Environmental MoE-based Transformer for Robust Event-guided Object Tracking
di: Chen, Yucheng, et al.
Pubblicazione: (2024)
di: Chen, Yucheng, et al.
Pubblicazione: (2024)
MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks
di: Zhu, Xingkui, et al.
Pubblicazione: (2024)
di: Zhu, Xingkui, et al.
Pubblicazione: (2024)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
di: Chen, Junyi, et al.
Pubblicazione: (2023)
di: Chen, Junyi, et al.
Pubblicazione: (2023)
InterMoE: Individual-Specific 3D Human Interaction Generation via Dynamic Temporal-Selective MoE
di: Wang, Lipeng, et al.
Pubblicazione: (2025)
di: Wang, Lipeng, et al.
Pubblicazione: (2025)
HiFi-MambaV2: Hierarchical Shared-Routed MoE for High-Fidelity MRI Reconstruction
di: Fang, Pengcheng, et al.
Pubblicazione: (2025)
di: Fang, Pengcheng, et al.
Pubblicazione: (2025)
BioFact-MoE: Biologically Factorized Mixture of Experts for Vision-Language Prognostic Modeling in Hepatocellular Carcinoma
di: Yang, Junlin, et al.
Pubblicazione: (2026)
di: Yang, Junlin, et al.
Pubblicazione: (2026)
Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Guiding the Experts: Semantic Priors for Efficient and Focused MoE Routing
di: Min, Chengxi, et al.
Pubblicazione: (2025)
di: Min, Chengxi, et al.
Pubblicazione: (2025)
Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
di: Liu, Xiangyue, et al.
Pubblicazione: (2026)
di: Liu, Xiangyue, et al.
Pubblicazione: (2026)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
di: Shi, Yangming, et al.
Pubblicazione: (2026)
di: Shi, Yangming, et al.
Pubblicazione: (2026)
SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025)
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025)
MD-Face: MoE-Enhanced Label-Free Disentangled Representation for Interactive Facial Attribute Editing
di: Cui, Xuan, et al.
Pubblicazione: (2026)
di: Cui, Xuan, et al.
Pubblicazione: (2026)
I2MoE: Interpretable Multimodal Interaction-aware Mixture-of-Experts
di: Xin, Jiayi, et al.
Pubblicazione: (2025)
di: Xin, Jiayi, et al.
Pubblicazione: (2025)
UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression
di: Zhao, Yuan, et al.
Pubblicazione: (2025)
di: Zhao, Yuan, et al.
Pubblicazione: (2025)
More Is Better: A MoE-Based Emotion Recognition Framework with Human Preference Alignment
di: Xie, Jun, et al.
Pubblicazione: (2025)
di: Xie, Jun, et al.
Pubblicazione: (2025)
RS-MoE: A Vision-Language Model with Mixture of Experts for Remote Sensing Image Captioning and Visual Question Answering
di: Lin, Hui, et al.
Pubblicazione: (2024)
di: Lin, Hui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MoCHA: Denoising Caption Supervision for Motion-Text Retrieval
di: Warner, Nikolai, et al.
Pubblicazione: (2026) -
MoCHA-former: Moiré-Conditioned Hybrid Adaptive Transformer for Video Demoiréing
di: Sung, Jeahun, et al.
Pubblicazione: (2025) -
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
di: Lin, Bin, et al.
Pubblicazione: (2024) -
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
di: Kong, Lingshun, et al.
Pubblicazione: (2026) -
CBDES MoE: Hierarchically Decoupled Mixture-of-Experts for Functional Modules in Autonomous Driving
di: Xiang, Qi, et al.
Pubblicazione: (2025)