OSCBench: Benchmarking Object State Change in Text-to-Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Xianjing, Zhu, Bin, Hu, Shiqi, Li, Franklin Mingzhe, Carrington, Patrick, Zimmermann, Roger, Chen, Jingjing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OSCAR: Object Status and Contextual Awareness for Recipes to Support Non-Visual Cooking
par: Li, Franklin Mingzhe, et autres
Publié: (2025)
par: Li, Franklin Mingzhe, et autres
Publié: (2025)
Exploring Object Status Recognition for Recipe Progress Tracking in Non-Visual Cooking
par: Li, Franklin Mingzhe, et autres
Publié: (2025)
par: Li, Franklin Mingzhe, et autres
Publié: (2025)
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
par: Li, Huiqiong, et autres
Publié: (2026)
par: Li, Huiqiong, et autres
Publié: (2026)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models
par: Cheng, Ming, et autres
Publié: (2025)
par: Cheng, Ming, et autres
Publié: (2025)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
par: Feng, Weixi, et autres
Publié: (2024)
par: Feng, Weixi, et autres
Publié: (2024)
Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model
par: Huang, Haoyang, et autres
Publié: (2025)
par: Huang, Haoyang, et autres
Publié: (2025)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
par: Tong, Jingqi, et autres
Publié: (2025)
par: Tong, Jingqi, et autres
Publié: (2025)
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
par: Fallah, Forouzan, et autres
Publié: (2025)
par: Fallah, Forouzan, et autres
Publié: (2025)
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
American Sign Language Video to Text Translation
par: Roy, Parsheeta, et autres
Publié: (2024)
par: Roy, Parsheeta, et autres
Publié: (2024)
More than One Step at a Time: Designing Procedural Feedback for Non-visual Makeup Routines
par: Li, Franklin Mingzhe, et autres
Publié: (2025)
par: Li, Franklin Mingzhe, et autres
Publié: (2025)
AutoArabic: A Three-Stage Framework for Localizing Video-Text Retrieval Benchmarks
par: Eltahir, Mohamed, et autres
Publié: (2025)
par: Eltahir, Mohamed, et autres
Publié: (2025)
Bilingual Text-to-Motion Generation: A New Benchmark and Baselines
par: Weng, Wanjiang, et autres
Publié: (2026)
par: Weng, Wanjiang, et autres
Publié: (2026)
Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text
par: Rahman, Mizanur, et autres
Publié: (2025)
par: Rahman, Mizanur, et autres
Publié: (2025)
The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation
par: Gao, Bingjie, et autres
Publié: (2025)
par: Gao, Bingjie, et autres
Publié: (2025)
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
par: Gao, Xin, et autres
Publié: (2026)
par: Gao, Xin, et autres
Publié: (2026)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
par: Zhou, Ziwei, et autres
Publié: (2026)
par: Zhou, Ziwei, et autres
Publié: (2026)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
par: Chen, Kaijie, et autres
Publié: (2025)
par: Chen, Kaijie, et autres
Publié: (2025)
Integrating Video and Text: A Balanced Approach to Multimodal Summary Generation and Evaluation
par: Pennec, Galann, et autres
Publié: (2025)
par: Pennec, Galann, et autres
Publié: (2025)
T$^3$Bench: Benchmarking Current Progress in Text-to-3D Generation
par: He, Yuze, et autres
Publié: (2023)
par: He, Yuze, et autres
Publié: (2023)
MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning
par: Luo, Yuxuan, et autres
Publié: (2025)
par: Luo, Yuxuan, et autres
Publié: (2025)
ColorConceptBench: A Benchmark for Probabilistic Color-Concept Understanding in Text-to-Image Models
par: Ruan, Chenxi, et autres
Publié: (2026)
par: Ruan, Chenxi, et autres
Publié: (2026)
LegalEval-Q: A New Benchmark for The Quality Evaluation of LLM-Generated Legal Text
par: yunhan, Li, et autres
Publié: (2025)
par: yunhan, Li, et autres
Publié: (2025)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
par: Wu, Yin, et autres
Publié: (2025)
par: Wu, Yin, et autres
Publié: (2025)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
par: Du, Yang, et autres
Publié: (2025)
par: Du, Yang, et autres
Publié: (2025)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
OSCaR: Object State Captioning and State Change Representation
par: Nguyen, Nguyen, et autres
Publié: (2024)
par: Nguyen, Nguyen, et autres
Publié: (2024)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
par: Liu, Xuannan, et autres
Publié: (2025)
par: Liu, Xuannan, et autres
Publié: (2025)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
par: Li, Jialu, et autres
Publié: (2025)
par: Li, Jialu, et autres
Publié: (2025)
Temporal Reasoning Transfer from Text to Video
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
par: Huang, Jia-Hong, et autres
Publié: (2024)
par: Huang, Jia-Hong, et autres
Publié: (2024)
RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models
par: Luo, Sha, et autres
Publié: (2026)
par: Luo, Sha, et autres
Publié: (2026)
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
par: Ozaki, Shintaro, et autres
Publié: (2025)
par: Ozaki, Shintaro, et autres
Publié: (2025)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
par: Zhu, Kejian, et autres
Publié: (2025)
par: Zhu, Kejian, et autres
Publié: (2025)
T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation
par: Guo, Xuyang, et autres
Publié: (2025)
par: Guo, Xuyang, et autres
Publié: (2025)
Actions and Objects Pathways for Domain Adaptation in Video Question Answering
par: Mohamud, Safaa Abdullahi Moallim, et autres
Publié: (2024)
par: Mohamud, Safaa Abdullahi Moallim, et autres
Publié: (2024)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
par: Cheng, Jiale, et autres
Publié: (2025)
par: Cheng, Jiale, et autres
Publié: (2025)
PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
par: Zhao, Yusong, et autres
Publié: (2026)
par: Zhao, Yusong, et autres
Publié: (2026)
Documents similaires
-
OSCAR: Object Status and Contextual Awareness for Recipes to Support Non-Visual Cooking
par: Li, Franklin Mingzhe, et autres
Publié: (2025) -
Exploring Object Status Recognition for Recipe Progress Tracking in Non-Visual Cooking
par: Li, Franklin Mingzhe, et autres
Publié: (2025) -
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
par: Li, Huiqiong, et autres
Publié: (2026) -
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024) -
VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models
par: Cheng, Ming, et autres
Publié: (2025)