UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Chen, Hu, ZeYang, Chen, Fengjiao, Ma, Liya, Liu, Jiaxing, Li, Xiaoyu, Wang, Ziwen, Cao, Xuezhi, Cai, Xunliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniHetero: Could Generation Enhance Understanding for Vision-Language-Model at Large Data Scale?
por: Chen, Fengjiao, et al.
Publicado: (2025)
por: Chen, Fengjiao, et al.
Publicado: (2025)
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
por: Pan, Leyi, et al.
Publicado: (2025)
por: Pan, Leyi, et al.
Publicado: (2025)
OmniFusion Technical Report
por: Goncharova, Elizaveta, et al.
Publicado: (2024)
por: Goncharova, Elizaveta, et al.
Publicado: (2024)
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
por: Wang, Haoyu, et al.
Publicado: (2025)
por: Wang, Haoyu, et al.
Publicado: (2025)
METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark
por: Yang, Xu, et al.
Publicado: (2025)
por: Yang, Xu, et al.
Publicado: (2025)
EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
por: Yang, Pei, et al.
Publicado: (2026)
por: Yang, Pei, et al.
Publicado: (2026)
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
por: Yang, Baoyao, et al.
Publicado: (2025)
por: Yang, Baoyao, et al.
Publicado: (2025)
MMSciBench: Benchmarking Language Models on Chinese Multimodal Scientific Problems
por: Ye, Xinwu, et al.
Publicado: (2025)
por: Ye, Xinwu, et al.
Publicado: (2025)
MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare
por: Wang, Yihao, et al.
Publicado: (2026)
por: Wang, Yihao, et al.
Publicado: (2026)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
por: Halpern, Bence Mark, et al.
Publicado: (2026)
por: Halpern, Bence Mark, et al.
Publicado: (2026)
XferBench: a Data-Driven Benchmark for Emergent Language
por: Boldt, Brendon, et al.
Publicado: (2024)
por: Boldt, Brendon, et al.
Publicado: (2024)
LLaMA-Omni: Seamless Speech Interaction with Large Language Models
por: Fang, Qingkai, et al.
Publicado: (2024)
por: Fang, Qingkai, et al.
Publicado: (2024)
BlasBench: An Open Benchmark for Irish Speech Recognition
por: Raj, Jyoutir, et al.
Publicado: (2026)
por: Raj, Jyoutir, et al.
Publicado: (2026)
PersistBench: When Should Long-Term Memories Be Forgotten by LLMs?
por: Pulipaka, Sidharth, et al.
Publicado: (2026)
por: Pulipaka, Sidharth, et al.
Publicado: (2026)
UniC-RAG: Universal Knowledge Corruption Attacks to Retrieval-Augmented Generation
por: Geng, Runpeng, et al.
Publicado: (2025)
por: Geng, Runpeng, et al.
Publicado: (2025)
Exploration of Augmentation Strategies in Multi-modal Retrieval-Augmented Generation for the Biomedical Domain: A Case Study Evaluating Question Answering in Glycobiology
por: Kocbek, Primož, et al.
Publicado: (2025)
por: Kocbek, Primož, et al.
Publicado: (2025)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
por: Schesch, Benedikt, et al.
Publicado: (2026)
por: Schesch, Benedikt, et al.
Publicado: (2026)
Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images
por: Chen, Yuangong, et al.
Publicado: (2026)
por: Chen, Yuangong, et al.
Publicado: (2026)
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
por: Tu, Songjun, et al.
Publicado: (2026)
por: Tu, Songjun, et al.
Publicado: (2026)
ContractBench: Can LLM Agents Preserve Observation Contracts?
por: Wang, Jicheng, et al.
Publicado: (2026)
por: Wang, Jicheng, et al.
Publicado: (2026)
ContextBench: A Benchmark for Context Retrieval in Coding Agents
por: Li, Han, et al.
Publicado: (2026)
por: Li, Han, et al.
Publicado: (2026)
Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models
por: Tian, Changxin, et al.
Publicado: (2025)
por: Tian, Changxin, et al.
Publicado: (2025)
EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
por: Jiang, Yilin, et al.
Publicado: (2025)
por: Jiang, Yilin, et al.
Publicado: (2025)
EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models
por: Paech, Samuel J.
Publicado: (2023)
por: Paech, Samuel J.
Publicado: (2023)
UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop
por: Shafique, Muhammad Ali, et al.
Publicado: (2026)
por: Shafique, Muhammad Ali, et al.
Publicado: (2026)
RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences
por: Zhou, Yangyang, et al.
Publicado: (2026)
por: Zhou, Yangyang, et al.
Publicado: (2026)
Evaluation Before Generation: A Paradigm for Robust Multimodal Sentiment Analysis with Missing Modalities
por: Chen, Rongfei, et al.
Publicado: (2026)
por: Chen, Rongfei, et al.
Publicado: (2026)
Low-Resource Court Judgment Summarization for Common Law Systems
por: Liu, Shuaiqi, et al.
Publicado: (2024)
por: Liu, Shuaiqi, et al.
Publicado: (2024)
PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI
por: Mukhopadhyay, Srija, et al.
Publicado: (2025)
por: Mukhopadhyay, Srija, et al.
Publicado: (2025)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
por: Ovcharov, Volodymyr
Publicado: (2026)
por: Ovcharov, Volodymyr
Publicado: (2026)
AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
por: Hu, Yuxuan, et al.
Publicado: (2026)
por: Hu, Yuxuan, et al.
Publicado: (2026)
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
por: Dai, Song, et al.
Publicado: (2025)
por: Dai, Song, et al.
Publicado: (2025)
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
por: Li, Bowen, et al.
Publicado: (2026)
por: Li, Bowen, et al.
Publicado: (2026)
CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities
por: Zhu, Yuxuan, et al.
Publicado: (2025)
por: Zhu, Yuxuan, et al.
Publicado: (2025)
ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges
por: Zhou, Yue, et al.
Publicado: (2025)
por: Zhou, Yue, et al.
Publicado: (2025)
Can AI Read Between The Lines? Benchmarking LLMs On Financial Nuance
por: Kubica, Dominick, et al.
Publicado: (2025)
por: Kubica, Dominick, et al.
Publicado: (2025)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
por: Gao, Yuxuan, et al.
Publicado: (2026)
por: Gao, Yuxuan, et al.
Publicado: (2026)
HalalBench: A Multilingual OCR Benchmark for Food Packaging Ingredient Extraction
por: Arief, Hasan
Publicado: (2026)
por: Arief, Hasan
Publicado: (2026)
MoodBench 1.0: An Evaluation Benchmark for Emotional Companionship Dialogue Systems
por: Jing, Haifeng, et al.
Publicado: (2025)
por: Jing, Haifeng, et al.
Publicado: (2025)
LCFO: Long Context and Long Form Output Dataset and Benchmarking
por: Costa-jussà, Marta R., et al.
Publicado: (2024)
por: Costa-jussà, Marta R., et al.
Publicado: (2024)
Ejemplares similares
-
UniHetero: Could Generation Enhance Understanding for Vision-Language-Model at Large Data Scale?
por: Chen, Fengjiao, et al.
Publicado: (2025) -
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
por: Pan, Leyi, et al.
Publicado: (2025) -
OmniFusion Technical Report
por: Goncharova, Elizaveta, et al.
Publicado: (2024) -
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
por: Wang, Haoyu, et al.
Publicado: (2025) -
METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark
por: Yang, Xu, et al.
Publicado: (2025)