Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Luo, Ziyang, Liu, Nian, Han, Junwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
di: Jia, Yiduo, et al.
Pubblicazione: (2026)
di: Jia, Yiduo, et al.
Pubblicazione: (2026)
VST++: Efficient and Stronger Visual Saliency Transformer
di: Liu, Nian, et al.
Pubblicazione: (2023)
di: Liu, Nian, et al.
Pubblicazione: (2023)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
di: Li, Long, et al.
Pubblicazione: (2025)
di: Li, Long, et al.
Pubblicazione: (2025)
OmniSat: Self-Supervised Modality Fusion for Earth Observation
di: Astruc, Guillaume, et al.
Pubblicazione: (2024)
di: Astruc, Guillaume, et al.
Pubblicazione: (2024)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
di: Peng, Haosong, et al.
Pubblicazione: (2025)
di: Peng, Haosong, et al.
Pubblicazione: (2025)
OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization
di: Han, Minghao, et al.
Pubblicazione: (2026)
di: Han, Minghao, et al.
Pubblicazione: (2026)
VSCode: General Visual Salient and Camouflaged Object Detection with 2D Prompt Learning
di: Luo, Ziyang, et al.
Pubblicazione: (2023)
di: Luo, Ziyang, et al.
Pubblicazione: (2023)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
di: Yang, Qize, et al.
Pubblicazione: (2025)
di: Yang, Qize, et al.
Pubblicazione: (2025)
Cross-Modal Synergies: Unveiling the Potential of Motion-Aware Fusion Networks in Handling Dynamic and Static ReID Scenarios
di: Ling, Fuxi, et al.
Pubblicazione: (2025)
di: Ling, Fuxi, et al.
Pubblicazione: (2025)
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
di: Chen, Feng, et al.
Pubblicazione: (2025)
di: Chen, Feng, et al.
Pubblicazione: (2025)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
di: Yang, Morunliu, et al.
Pubblicazione: (2026)
di: Yang, Morunliu, et al.
Pubblicazione: (2026)
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
di: Li, Mingxiao, et al.
Pubblicazione: (2025)
di: Li, Mingxiao, et al.
Pubblicazione: (2025)
Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation
di: Liao, Chao, et al.
Pubblicazione: (2025)
di: Liao, Chao, et al.
Pubblicazione: (2025)
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
di: Han, Su Ho, et al.
Pubblicazione: (2025)
di: Han, Su Ho, et al.
Pubblicazione: (2025)
OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
Is Extending Modality The Right Path Towards Omni-Modality?
di: Zhu, Tinghui, et al.
Pubblicazione: (2025)
di: Zhu, Tinghui, et al.
Pubblicazione: (2025)
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
di: Ye, Hanrong, et al.
Pubblicazione: (2025)
di: Ye, Hanrong, et al.
Pubblicazione: (2025)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
di: Cheng, Xize, et al.
Pubblicazione: (2024)
di: Cheng, Xize, et al.
Pubblicazione: (2024)
Modality Unified Attack for Omni-Modality Person Re-Identification
di: Bian, Yuan, et al.
Pubblicazione: (2025)
di: Bian, Yuan, et al.
Pubblicazione: (2025)
Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs
di: Wang, Zitian, et al.
Pubblicazione: (2025)
di: Wang, Zitian, et al.
Pubblicazione: (2025)
Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
di: Su, Yongyi, et al.
Pubblicazione: (2025)
di: Su, Yongyi, et al.
Pubblicazione: (2025)
Dynamic Attention and Bi-directional Fusion for Safety Helmet Wearing Detection
di: Feng, Junwei, et al.
Pubblicazione: (2024)
di: Feng, Junwei, et al.
Pubblicazione: (2024)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
di: Dai, Yifan, et al.
Pubblicazione: (2026)
di: Dai, Yifan, et al.
Pubblicazione: (2026)
Omni-Fusion of Spatial and Spectral for Hyperspectral Image Segmentation
di: Zhang, Qing, et al.
Pubblicazione: (2025)
di: Zhang, Qing, et al.
Pubblicazione: (2025)
SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs
di: Lou, Haoran, et al.
Pubblicazione: (2026)
di: Lou, Haoran, et al.
Pubblicazione: (2026)
From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs
di: Li, Mingxiao, et al.
Pubblicazione: (2025)
di: Li, Mingxiao, et al.
Pubblicazione: (2025)
From GPT-4 to Gemini and Beyond: Assessing the Landscape of MLLMs on Generalizability, Trustworthiness and Causality through Four Modalities
di: Lu, Chaochao, et al.
Pubblicazione: (2024)
di: Lu, Chaochao, et al.
Pubblicazione: (2024)
STORM: Strategic Orchestration of Modalities for Rare Event Classification
di: Kamboj, Payal, et al.
Pubblicazione: (2024)
di: Kamboj, Payal, et al.
Pubblicazione: (2024)
OmniGCD: Abstracting Generalized Category Discovery for Modality Agnosticism
di: Shipard, Jordan, et al.
Pubblicazione: (2026)
di: Shipard, Jordan, et al.
Pubblicazione: (2026)
Part-Whole Relational Fusion Towards Multi-Modal Scene Understanding
di: Liu, Yi, et al.
Pubblicazione: (2024)
di: Liu, Yi, et al.
Pubblicazione: (2024)
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
di: Xin, Yi, et al.
Pubblicazione: (2025)
di: Xin, Yi, et al.
Pubblicazione: (2025)
Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality
di: Qian, Kai, et al.
Pubblicazione: (2026)
di: Qian, Kai, et al.
Pubblicazione: (2026)
GTP-4o: Modality-prompted Heterogeneous Graph Learning for Omni-modal Biomedical Representation
di: Li, Chenxin, et al.
Pubblicazione: (2024)
di: Li, Chenxin, et al.
Pubblicazione: (2024)
OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imaging
di: Liu, Meilin, et al.
Pubblicazione: (2026)
di: Liu, Meilin, et al.
Pubblicazione: (2026)
Integrating MedCLIP and Cross-Modal Fusion for Automatic Radiology Report Generation
di: Han, Qianhao, et al.
Pubblicazione: (2024)
di: Han, Qianhao, et al.
Pubblicazione: (2024)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
di: Chen, Junyi, et al.
Pubblicazione: (2026)
di: Chen, Junyi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
di: Jia, Yiduo, et al.
Pubblicazione: (2026) -
VST++: Efficient and Stronger Visual Saliency Transformer
di: Liu, Nian, et al.
Pubblicazione: (2023) -
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
di: Luo, Ziyang, et al.
Pubblicazione: (2025) -
Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
di: Li, Long, et al.
Pubblicazione: (2025) -
OmniSat: Self-Supervised Modality Fusion for Earth Observation
di: Astruc, Guillaume, et al.
Pubblicazione: (2024)