SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Andong, Wu, Bo, Chen, Sunli, Chen, Zhenfang, Guan, Haotian, Lee, Wei-Ning, Li, Li Erran, Gan, Chuang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
STAR: A Benchmark for Situated Reasoning in Real-World Videos
di: Wu, Bo, et al.
Pubblicazione: (2024)
di: Wu, Bo, et al.
Pubblicazione: (2024)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
di: Zhang, Shun, et al.
Pubblicazione: (2024)
di: Zhang, Shun, et al.
Pubblicazione: (2024)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
di: Deng, Andong, et al.
Pubblicazione: (2026)
di: Deng, Andong, et al.
Pubblicazione: (2026)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
Compositional Physical Reasoning of Objects and Events from Videos
di: Chen, Zhenfang, et al.
Pubblicazione: (2024)
di: Chen, Zhenfang, et al.
Pubblicazione: (2024)
Video-Bench: Human-Aligned Video Generation Benchmark
di: Han, Hui, et al.
Pubblicazione: (2025)
di: Han, Hui, et al.
Pubblicazione: (2025)
ContPhy: Continuum Physical Concept Learning and Reasoning from Videos
di: Zheng, Zhicheng, et al.
Pubblicazione: (2024)
di: Zheng, Zhicheng, et al.
Pubblicazione: (2024)
SOK: Blockchain for Provenance
di: Akbarfam, Asma Jodeiri, et al.
Pubblicazione: (2024)
di: Akbarfam, Asma Jodeiri, et al.
Pubblicazione: (2024)
WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors
di: Wu, Keming, et al.
Pubblicazione: (2026)
di: Wu, Keming, et al.
Pubblicazione: (2026)
Mars: Situated Inductive Reasoning in an Open-World Environment
di: Tang, Xiaojuan, et al.
Pubblicazione: (2024)
di: Tang, Xiaojuan, et al.
Pubblicazione: (2024)
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
di: Li, Huiqiong, et al.
Pubblicazione: (2026)
di: Li, Huiqiong, et al.
Pubblicazione: (2026)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
di: Chen, Yubin, et al.
Pubblicazione: (2025)
di: Chen, Yubin, et al.
Pubblicazione: (2025)
TextPSG: Panoptic Scene Graph Generation from Textual Descriptions
di: Zhao, Chengyang, et al.
Pubblicazione: (2023)
di: Zhao, Chengyang, et al.
Pubblicazione: (2023)
Virtual Community: An Open World for Humans, Robots, and Society
di: Zhou, Qinhong, et al.
Pubblicazione: (2025)
di: Zhou, Qinhong, et al.
Pubblicazione: (2025)
COMBO: Compositional World Models for Embodied Multi-Agent Cooperation
di: Zhang, Hongxin, et al.
Pubblicazione: (2024)
di: Zhang, Hongxin, et al.
Pubblicazione: (2024)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
di: Zhang, Daoan, et al.
Pubblicazione: (2025)
di: Zhang, Daoan, et al.
Pubblicazione: (2025)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
Are Video Models Zero-Shot Learners and Reasoners in Education? EduVideoBench, A Knowledge-Skills-Attitude Benchmark for Educational Video Generation
di: Lee, Unggi, et al.
Pubblicazione: (2026)
di: Lee, Unggi, et al.
Pubblicazione: (2026)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
di: Wu, Haoning, et al.
Pubblicazione: (2024)
di: Wu, Haoning, et al.
Pubblicazione: (2024)
SAW-Bench: Learning Situated Awareness in the Real World
di: Li, Chuhan, et al.
Pubblicazione: (2026)
di: Li, Chuhan, et al.
Pubblicazione: (2026)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
di: Li, Hengzhi, et al.
Pubblicazione: (2025)
di: Li, Hengzhi, et al.
Pubblicazione: (2025)
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
di: Lin, Guan-Ting, et al.
Pubblicazione: (2026)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2026)
FlexAttention for Efficient High-Resolution Vision-Language Models
di: Li, Junyan, et al.
Pubblicazione: (2024)
di: Li, Junyan, et al.
Pubblicazione: (2024)
Evaluating Step-by-Step Reasoning through Symbolic Verification
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2022)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2022)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
di: Shen, Maohao, et al.
Pubblicazione: (2025)
di: Shen, Maohao, et al.
Pubblicazione: (2025)
PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks
di: Jang, Yehoon, et al.
Pubblicazione: (2026)
di: Jang, Yehoon, et al.
Pubblicazione: (2026)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
HAZARD Challenge: Embodied Decision Making in Dynamically Changing Environments
di: Zhou, Qinhong, et al.
Pubblicazione: (2024)
di: Zhou, Qinhong, et al.
Pubblicazione: (2024)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
di: Feng, Weixi, et al.
Pubblicazione: (2024)
di: Feng, Weixi, et al.
Pubblicazione: (2024)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
di: Chen, Boyu, et al.
Pubblicazione: (2024)
di: Chen, Boyu, et al.
Pubblicazione: (2024)
LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
di: Gao, Zihan, et al.
Pubblicazione: (2025)
di: Gao, Zihan, et al.
Pubblicazione: (2025)
GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling
di: Li, Siqi, et al.
Pubblicazione: (2025)
di: Li, Siqi, et al.
Pubblicazione: (2025)
RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models
di: Luo, Sha, et al.
Pubblicazione: (2026)
di: Luo, Sha, et al.
Pubblicazione: (2026)
VE-Bench: Subjective-Aligned Benchmark Suite for Text-Driven Video Editing Quality Assessment
di: Sun, Shangkun, et al.
Pubblicazione: (2024)
di: Sun, Shangkun, et al.
Pubblicazione: (2024)
V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
di: Luo, Yang, et al.
Pubblicazione: (2025)
di: Luo, Yang, et al.
Pubblicazione: (2025)
Aligning VLM Assistants with Personalized Situated Cognition
di: Li, Yongqi, et al.
Pubblicazione: (2025)
di: Li, Yongqi, et al.
Pubblicazione: (2025)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
di: Fang, I-Sheng, et al.
Pubblicazione: (2025)
di: Fang, I-Sheng, et al.
Pubblicazione: (2025)
ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness
di: Liang, Yijun, et al.
Pubblicazione: (2025)
di: Liang, Yijun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
STAR: A Benchmark for Situated Reasoning in Real-World Videos
di: Wu, Bo, et al.
Pubblicazione: (2024) -
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
di: Zhang, Shun, et al.
Pubblicazione: (2024) -
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
di: Deng, Andong, et al.
Pubblicazione: (2026) -
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025) -
Compositional Physical Reasoning of Objects and Events from Videos
di: Chen, Zhenfang, et al.
Pubblicazione: (2024)