FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Qian, Fu, Jinlan, Li, Changsong, Ng, See-Kiong, Qiu, Xipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RoboOmni: Proactive Robot Manipulation in Omni-modal Context
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
por: Chen, Yijing, et al.
Publicado: (2025)
por: Chen, Yijing, et al.
Publicado: (2025)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
por: Fu, Jinlan, et al.
Publicado: (2025)
por: Fu, Jinlan, et al.
Publicado: (2025)
OmniGAIA: Towards Native Omni-Modal AI Agents
por: Li, Xiaoxi, et al.
Publicado: (2026)
por: Li, Xiaoxi, et al.
Publicado: (2026)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
por: Wang, Chengyao, et al.
Publicado: (2025)
por: Wang, Chengyao, et al.
Publicado: (2025)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
por: Bin, Yi, et al.
Publicado: (2024)
por: Bin, Yi, et al.
Publicado: (2024)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
por: Zhang, Haowei, et al.
Publicado: (2026)
por: Zhang, Haowei, et al.
Publicado: (2026)
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
por: Zhang, Yi-Kai, et al.
Publicado: (2024)
por: Zhang, Yi-Kai, et al.
Publicado: (2024)
Calibrated Multimodal Representation Learning with Missing Modalities
por: Liu, Xiaohao, et al.
Publicado: (2025)
por: Liu, Xiaohao, et al.
Publicado: (2025)
Principled Multimodal Representation Learning
por: Liu, Xiaohao, et al.
Publicado: (2025)
por: Liu, Xiaohao, et al.
Publicado: (2025)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
por: Han, ZhaoYang, et al.
Publicado: (2025)
por: Han, ZhaoYang, et al.
Publicado: (2025)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance
por: Liu, Renyang, et al.
Publicado: (2024)
por: Liu, Renyang, et al.
Publicado: (2024)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
por: Hao, Jing, et al.
Publicado: (2025)
por: Hao, Jing, et al.
Publicado: (2025)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
por: Cheng, Xize, et al.
Publicado: (2024)
por: Cheng, Xize, et al.
Publicado: (2024)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
por: Chen, Yuheng, et al.
Publicado: (2026)
por: Chen, Yuheng, et al.
Publicado: (2026)
Ola: Pushing the Frontiers of Omni-Modal Language Model
por: Liu, Zuyan, et al.
Publicado: (2025)
por: Liu, Zuyan, et al.
Publicado: (2025)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
por: Liu, Che, et al.
Publicado: (2026)
por: Liu, Che, et al.
Publicado: (2026)
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
por: Zhong, Zhisheng, et al.
Publicado: (2024)
por: Zhong, Zhisheng, et al.
Publicado: (2024)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
por: Yang, Qize, et al.
Publicado: (2025)
por: Yang, Qize, et al.
Publicado: (2025)
Omni-C: Compressing Heterogeneous Modalities into a Single Dense Encoder
por: Lau, Kin Wai, et al.
Publicado: (2026)
por: Lau, Kin Wai, et al.
Publicado: (2026)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
por: Su, Yaofeng, et al.
Publicado: (2026)
por: Su, Yaofeng, et al.
Publicado: (2026)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
por: Pu, Junfu, et al.
Publicado: (2026)
por: Pu, Junfu, et al.
Publicado: (2026)
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
por: Westermann, Hannes, et al.
Publicado: (2024)
por: Westermann, Hannes, et al.
Publicado: (2024)
Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective
por: Wang, Bing, et al.
Publicado: (2025)
por: Wang, Bing, et al.
Publicado: (2025)
Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
por: Cai, Zhongang, et al.
Publicado: (2025)
por: Cai, Zhongang, et al.
Publicado: (2025)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
por: An, Wenbin, et al.
Publicado: (2025)
por: An, Wenbin, et al.
Publicado: (2025)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
por: Liu, Jing, et al.
Publicado: (2023)
por: Liu, Jing, et al.
Publicado: (2023)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
por: Dai, Yusheng, et al.
Publicado: (2026)
por: Dai, Yusheng, et al.
Publicado: (2026)
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
por: Zhu, Zhihao, et al.
Publicado: (2026)
por: Zhu, Zhihao, et al.
Publicado: (2026)
PetalView: Fine-grained Location and Orientation Extraction of Street-view Images via Cross-view Local Search with Supplementary Materials
por: Hu, Wenmiao, et al.
Publicado: (2024)
por: Hu, Wenmiao, et al.
Publicado: (2024)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
por: Pian, Weiguo, et al.
Publicado: (2026)
por: Pian, Weiguo, et al.
Publicado: (2026)
OmniBench: Towards The Future of Universal Omni-Language Models
por: Li, Yizhi, et al.
Publicado: (2024)
por: Li, Yizhi, et al.
Publicado: (2024)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
por: Yan, Qianqi, et al.
Publicado: (2026)
por: Yan, Qianqi, et al.
Publicado: (2026)
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
por: Li, Shufan, et al.
Publicado: (2024)
por: Li, Shufan, et al.
Publicado: (2024)
A Review of Multimodal Explainable Artificial Intelligence: Past, Present and Future
por: Sun, Shilin, et al.
Publicado: (2024)
por: Sun, Shilin, et al.
Publicado: (2024)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
por: Wu, Jiaying, et al.
Publicado: (2025)
por: Wu, Jiaying, et al.
Publicado: (2025)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
por: Jiang, Ruixiang, et al.
Publicado: (2025)
por: Jiang, Ruixiang, et al.
Publicado: (2025)
Towards Robust Multimodal Emotion Recognition under Missing Modalities and Distribution Shifts
por: Zhong, Guowei, et al.
Publicado: (2025)
por: Zhong, Guowei, et al.
Publicado: (2025)
Ejemplares similares
-
RoboOmni: Proactive Robot Manipulation in Omni-modal Context
por: Wang, Siyin, et al.
Publicado: (2025) -
ChronusOmni: Improving Time Awareness of Omni Large Language Models
por: Chen, Yijing, et al.
Publicado: (2025) -
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
por: Ma, Ziyang, et al.
Publicado: (2025) -
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
por: Fu, Jinlan, et al.
Publicado: (2025) -
OmniGAIA: Towards Native Omni-Modal AI Agents
por: Li, Xiaoxi, et al.
Publicado: (2026)