OmniBench: Towards The Future of Universal Omni-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Yizhi, Ma, Yinghao, Zhang, Ge, Yuan, Ruibin, Zhu, Kang, Guo, Hangyu, Liang, Yiming, Liu, Jiaheng, Wang, Zekun, Yang, Jian, Wu, Siwei, Qu, Xingwei, Shi, Jinjie, Zhang, Xinyue, Yang, Zhenzhu, Wen, Yidan, Wang, Yanghai, Li, Shihao, Zhang, Zhaoxiang, Liu, Zachary, Benetos, Emmanouil, Huang, Wenhao, Lin, Chenghua |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
von: Li, Caorui, et al.
Veröffentlicht: (2025)
von: Li, Caorui, et al.
Veröffentlicht: (2025)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
von: Tang, Xiaoxuan, et al.
Veröffentlicht: (2025)
von: Tang, Xiaoxuan, et al.
Veröffentlicht: (2025)
Overview of the NLPCC 2024 Shared Task on Chinese Metaphor Generation
von: Qu, Xingwei, et al.
Veröffentlicht: (2024)
von: Qu, Xingwei, et al.
Veröffentlicht: (2024)
What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
von: Bu, Wendong, et al.
Veröffentlicht: (2025)
von: Bu, Wendong, et al.
Veröffentlicht: (2025)
OmniBench-RAG: A Multi-Domain Evaluation Platform for Retrieval-Augmented Generation Tools
von: Liang, Jiaxuan, et al.
Veröffentlicht: (2025)
von: Liang, Jiaxuan, et al.
Veröffentlicht: (2025)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
von: Yang, Morunliu, et al.
Veröffentlicht: (2026)
von: Yang, Morunliu, et al.
Veröffentlicht: (2026)
OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
von: Ding, Yue, et al.
Veröffentlicht: (2026)
von: Ding, Yue, et al.
Veröffentlicht: (2026)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
von: Taheri, Termeh, et al.
Veröffentlicht: (2025)
von: Taheri, Termeh, et al.
Veröffentlicht: (2025)
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
von: Zhuo, Le, et al.
Veröffentlicht: (2023)
von: Zhuo, Le, et al.
Veröffentlicht: (2023)
I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm
von: Liang, Yiming, et al.
Veröffentlicht: (2024)
von: Liang, Yiming, et al.
Veröffentlicht: (2024)
CXR‐ODDet: An Omni‐Decoupled Multi‐Class Lesion Localization Framework for Automatic Chest X‐Ray Analysis
von: Qing Zhang, et al.
Veröffentlicht: (2025)
von: Qing Zhang, et al.
Veröffentlicht: (2025)
Omni-scale Learning-based Sequential Decision Framework for Order Fulfillment of Tote-handling Robotic Systems
von: Liu, Jiaxin, et al.
Veröffentlicht: (2026)
von: Liu, Jiaxin, et al.
Veröffentlicht: (2026)
OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization
von: Han, Minghao, et al.
Veröffentlicht: (2026)
von: Han, Minghao, et al.
Veröffentlicht: (2026)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
von: Peng, Haosong, et al.
Veröffentlicht: (2025)
von: Peng, Haosong, et al.
Veröffentlicht: (2025)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
von: Zhou, Ziya, et al.
Veröffentlicht: (2024)
von: Zhou, Ziya, et al.
Veröffentlicht: (2024)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
von: Tian, Zeyue, et al.
Veröffentlicht: (2026)
von: Tian, Zeyue, et al.
Veröffentlicht: (2026)
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
von: Deng, Zihao, et al.
Veröffentlicht: (2023)
von: Deng, Zihao, et al.
Veröffentlicht: (2023)
Kling-Omni Technical Report
von: Kling Team, et al.
Veröffentlicht: (2025)
von: Kling Team, et al.
Veröffentlicht: (2025)
Explore the Limits of Omni-modal Pretraining at Scale
von: Zhang, Yiyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Yiyuan, et al.
Veröffentlicht: (2024)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
von: Wang, Zehan, et al.
Veröffentlicht: (2024)
von: Wang, Zehan, et al.
Veröffentlicht: (2024)
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
von: Ma, Yinghao, et al.
Veröffentlicht: (2026)
von: Ma, Yinghao, et al.
Veröffentlicht: (2026)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
von: Yang, Liu, et al.
Veröffentlicht: (2025)
von: Yang, Liu, et al.
Veröffentlicht: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
von: Wang, Chengyao, et al.
Veröffentlicht: (2025)
von: Wang, Chengyao, et al.
Veröffentlicht: (2025)
CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following
von: Ma, Yinghao, et al.
Veröffentlicht: (2025)
von: Ma, Yinghao, et al.
Veröffentlicht: (2025)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
von: Xi, Dianbing, et al.
Veröffentlicht: (2025)
von: Xi, Dianbing, et al.
Veröffentlicht: (2025)
OmniRe: Omni Urban Scene Reconstruction
von: Chen, Ziyu, et al.
Veröffentlicht: (2024)
von: Chen, Ziyu, et al.
Veröffentlicht: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
Omni-Scene: Omni-Gaussian Representation for Ego-Centric Sparse-View Scene Reconstruction
von: Wei, Dongxu, et al.
Veröffentlicht: (2024)
von: Wei, Dongxu, et al.
Veröffentlicht: (2024)
OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework
von: Zeng, Weixuan, et al.
Veröffentlicht: (2026)
von: Zeng, Weixuan, et al.
Veröffentlicht: (2026)
Baichuan-Omni Technical Report
von: Li, Yadong, et al.
Veröffentlicht: (2024)
von: Li, Yadong, et al.
Veröffentlicht: (2024)
Logics-Parsing-Omni Technical Report
von: An, Xin, et al.
Veröffentlicht: (2026)
von: An, Xin, et al.
Veröffentlicht: (2026)
Baichuan-Omni-1.5 Technical Report
von: Li, Yadong, et al.
Veröffentlicht: (2025)
von: Li, Yadong, et al.
Veröffentlicht: (2025)
OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning
von: Liu, Mushui, et al.
Veröffentlicht: (2024)
von: Liu, Mushui, et al.
Veröffentlicht: (2024)
Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models
von: Zhang, Haoyu, et al.
Veröffentlicht: (2026)
von: Zhang, Haoyu, et al.
Veröffentlicht: (2026)
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
von: Peng, Tianhao, et al.
Veröffentlicht: (2025)
von: Peng, Tianhao, et al.
Veröffentlicht: (2025)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
von: Yao, Jiali, et al.
Veröffentlicht: (2025)
von: Yao, Jiali, et al.
Veröffentlicht: (2025)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
von: Fu, Ronghao, et al.
Veröffentlicht: (2026)
von: Fu, Ronghao, et al.
Veröffentlicht: (2026)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
von: Dai, Yifan, et al.
Veröffentlicht: (2026)
von: Dai, Yifan, et al.
Veröffentlicht: (2026)
OmniPrism: Learning Disentangled Visual Concept for Image Generation
von: Li, Yangyang, et al.
Veröffentlicht: (2024)
von: Li, Yangyang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
von: Li, Caorui, et al.
Veröffentlicht: (2025) -
AutoMV: An Automatic Multi-Agent System for Music Video Generation
von: Tang, Xiaoxuan, et al.
Veröffentlicht: (2025) -
Overview of the NLPCC 2024 Shared Task on Chinese Metaphor Generation
von: Qu, Xingwei, et al.
Veröffentlicht: (2024) -
What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
von: Bu, Wendong, et al.
Veröffentlicht: (2025) -
OmniBench-RAG: A Multi-Domain Evaluation Platform for Retrieval-Augmented Generation Tools
von: Liang, Jiaxuan, et al.
Veröffentlicht: (2025)