Is Extending Modality The Right Path Towards Omni-Modality?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Tinghui, Zhang, Kai, Chen, Muhao, Su, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
par: Huang, Yixu, et autres
Publié: (2026)
par: Huang, Yixu, et autres
Publié: (2026)
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
par: Zhu, Boyu, et autres
Publié: (2025)
par: Zhu, Boyu, et autres
Publié: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
par: Jin, Zhuoran, et autres
Publié: (2025)
par: Jin, Zhuoran, et autres
Publié: (2025)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
par: Yang, Qize, et autres
Publié: (2025)
par: Yang, Qize, et autres
Publié: (2025)
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
par: Ye, Hanrong, et autres
Publié: (2025)
par: Ye, Hanrong, et autres
Publié: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
par: Dai, Yifan, et autres
Publié: (2026)
par: Dai, Yifan, et autres
Publié: (2026)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
par: Zhou, Ziwei, et autres
Publié: (2025)
par: Zhou, Ziwei, et autres
Publié: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
OmniGAIA: Towards Native Omni-Modal AI Agents
par: Li, Xiaoxi, et autres
Publié: (2026)
par: Li, Xiaoxi, et autres
Publié: (2026)
Efficient and High-Fidelity Omni Modality Retrieval
par: Huynh, Chuong, et autres
Publié: (2026)
par: Huynh, Chuong, et autres
Publié: (2026)
Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models
par: Ji, Xingguang, et autres
Publié: (2025)
par: Ji, Xingguang, et autres
Publié: (2025)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
par: Jia, Yiduo, et autres
Publié: (2026)
par: Jia, Yiduo, et autres
Publié: (2026)
Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality
par: Qian, Kai, et autres
Publié: (2026)
par: Qian, Kai, et autres
Publié: (2026)
MoExtend: Tuning New Experts for Modality and Task Extension
par: Zhong, Shanshan, et autres
Publié: (2024)
par: Zhong, Shanshan, et autres
Publié: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization
par: Chaubey, Ashutosh, et autres
Publié: (2026)
par: Chaubey, Ashutosh, et autres
Publié: (2026)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization
par: Zhang, Yanghai, et autres
Publié: (2024)
par: Zhang, Yanghai, et autres
Publié: (2024)
Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion
par: Shi, Yi, et autres
Publié: (2025)
par: Shi, Yi, et autres
Publié: (2025)
OmniBench: Towards The Future of Universal Omni-Language Models
par: Li, Yizhi, et autres
Publié: (2024)
par: Li, Yizhi, et autres
Publié: (2024)
Judge Anything: MLLM as a Judge Across Any Modality
par: Pu, Shu, et autres
Publié: (2025)
par: Pu, Shu, et autres
Publié: (2025)
MotionGPT3: Human Motion as a Second Modality
par: Zhu, Bingfan, et autres
Publié: (2025)
par: Zhu, Bingfan, et autres
Publié: (2025)
OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization
par: Han, Minghao, et autres
Publié: (2026)
par: Han, Minghao, et autres
Publié: (2026)
LongCat-Next: Lexicalizing Modalities as Discrete Tokens
par: Meituan LongCat Team, et autres
Publié: (2026)
par: Meituan LongCat Team, et autres
Publié: (2026)
Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
par: Huang, Siteng, et autres
Publié: (2023)
par: Huang, Siteng, et autres
Publié: (2023)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
par: Peng, Haosong, et autres
Publié: (2025)
par: Peng, Haosong, et autres
Publié: (2025)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
par: Xu, Zhiyang, et autres
Publié: (2024)
par: Xu, Zhiyang, et autres
Publié: (2024)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
par: Liu, Jie, et autres
Publié: (2024)
par: Liu, Jie, et autres
Publié: (2024)
MMGR: Multi-Modal Generative Reasoning
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
par: Zhu, Yichen, et autres
Publié: (2024)
par: Zhu, Yichen, et autres
Publié: (2024)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
par: Chen, Yingfa, et autres
Publié: (2024)
par: Chen, Yingfa, et autres
Publié: (2024)
Otter: A Multi-Modal Model with In-Context Instruction Tuning
par: Li, Bo, et autres
Publié: (2023)
par: Li, Bo, et autres
Publié: (2023)
Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
par: Li, Qian, et autres
Publié: (2024)
par: Li, Qian, et autres
Publié: (2024)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
par: Zhang, Yuechen, et autres
Publié: (2023)
par: Zhang, Yuechen, et autres
Publié: (2023)
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
par: Tang, Yihong, et autres
Publié: (2026)
par: Tang, Yihong, et autres
Publié: (2026)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
par: Zang, Yuhang, et autres
Publié: (2025)
par: Zang, Yuhang, et autres
Publié: (2025)
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
par: Westermann, Hannes, et autres
Publié: (2024)
par: Westermann, Hannes, et autres
Publié: (2024)
$\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs
par: Fan, Yingqi, et autres
Publié: (2025)
par: Fan, Yingqi, et autres
Publié: (2025)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
par: Yu, Jiazuo, et autres
Publié: (2024)
par: Yu, Jiazuo, et autres
Publié: (2024)
Documents similaires
-
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
par: Huang, Yixu, et autres
Publié: (2026) -
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
par: Zhu, Boyu, et autres
Publié: (2025) -
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024) -
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
par: Jin, Zhuoran, et autres
Publié: (2025) -
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
par: Yang, Qize, et autres
Publié: (2025)