Sekai: A Video Dataset towards World Exploration
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Zhen, Li, Chuanhao, Mao, Xiaofeng, Lin, Shaoheng, Li, Ming, Zhao, Shitian, Xu, Zhaopan, Li, Xinyue, Feng, Yukang, Sun, Jianwen, Li, Zizhen, Zhang, Fanrui, Ai, Jiaxin, Wang, Zhixiang, Wu, Yuwei, He, Tong, Pang, Jiangmiao, Qiao, Yu, Jia, Yunde, Zhang, Kaipeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Closing the Expression Gap in LLM Instructions via Socratic Questioning
von: Sun, Jianwen, et al.
Veröffentlicht: (2025)
von: Sun, Jianwen, et al.
Veröffentlicht: (2025)
From Pixels to Paths: A Multi-Agent Framework for Editable Scientific Illustration
von: Sun, Jianwen, et al.
Veröffentlicht: (2025)
von: Sun, Jianwen, et al.
Veröffentlicht: (2025)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
von: Sun, Jianwen, et al.
Veröffentlicht: (2025)
von: Sun, Jianwen, et al.
Veröffentlicht: (2025)
MeepleLM: A Virtual Playtester Simulating Diverse Subjective Experiences
von: Li, Zizhen, et al.
Veröffentlicht: (2026)
von: Li, Zizhen, et al.
Veröffentlicht: (2026)
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
von: Ai, Jiaxin, et al.
Veröffentlicht: (2025)
von: Ai, Jiaxin, et al.
Veröffentlicht: (2025)
A High-Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation
von: Feng, Yukang, et al.
Veröffentlicht: (2025)
von: Feng, Yukang, et al.
Veröffentlicht: (2025)
InMind: Evaluating LLMs in Capturing and Applying Individual Human Reasoning Styles
von: Li, Zizhen, et al.
Veröffentlicht: (2025)
von: Li, Zizhen, et al.
Veröffentlicht: (2025)
World Craft: Agentic Framework to Create Visualizable Worlds via Text
von: Sun, Jianwen, et al.
Veröffentlicht: (2026)
von: Sun, Jianwen, et al.
Veröffentlicht: (2026)
ProSoftArena: Benchmarking Hierarchical Capabilities of Multimodal Agents in Professional Software Environments
von: Ai, Jiaxin, et al.
Veröffentlicht: (2025)
von: Ai, Jiaxin, et al.
Veröffentlicht: (2025)
AutoBG: A Board Game Design Assistant with Interactive Ideation, Iterative Rulebook Generation, and Individualized Feedback
von: Li, Zizhen, et al.
Veröffentlicht: (2026)
von: Li, Zizhen, et al.
Veröffentlicht: (2026)
Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection
von: Zhang, Fanrui, et al.
Veröffentlicht: (2025)
von: Zhang, Fanrui, et al.
Veröffentlicht: (2025)
Yume: An Interactive World Generation Model
von: Mao, Xiaofeng, et al.
Veröffentlicht: (2025)
von: Mao, Xiaofeng, et al.
Veröffentlicht: (2025)
SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model
von: Chang, Yifan, et al.
Veröffentlicht: (2025)
von: Chang, Yifan, et al.
Veröffentlicht: (2025)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
von: Zhou, Pengfei, et al.
Veröffentlicht: (2025)
von: Zhou, Pengfei, et al.
Veröffentlicht: (2025)
MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams
von: Zhou, Pengfei, et al.
Veröffentlicht: (2025)
von: Zhou, Pengfei, et al.
Veröffentlicht: (2025)
Yume-1.5: A Text-Controlled Interactive World Generation Model
von: Mao, Xiaofeng, et al.
Veröffentlicht: (2025)
von: Mao, Xiaofeng, et al.
Veröffentlicht: (2025)
IA-T2I: Internet-Augmented Text-to-Image Generation
von: Li, Chuanhao, et al.
Veröffentlicht: (2025)
von: Li, Chuanhao, et al.
Veröffentlicht: (2025)
LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces
von: Feng, Yukang, et al.
Veröffentlicht: (2026)
von: Feng, Yukang, et al.
Veröffentlicht: (2026)
Multi-Sourced Compositional Generalization in Visual Question Answering
von: Li, Chuanhao, et al.
Veröffentlicht: (2025)
von: Li, Chuanhao, et al.
Veröffentlicht: (2025)
PyVision: Agentic Vision with Dynamic Tooling
von: Zhao, Shitian, et al.
Veröffentlicht: (2025)
von: Zhao, Shitian, et al.
Veröffentlicht: (2025)
PyVision-RL: Forging Open Agentic Vision Models via RL
von: Zhao, Shitian, et al.
Veröffentlicht: (2026)
von: Zhao, Shitian, et al.
Veröffentlicht: (2026)
Composition-Incremental Learning for Compositional Generalization
von: Li, Zhen, et al.
Veröffentlicht: (2025)
von: Li, Zhen, et al.
Veröffentlicht: (2025)
WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG
von: Li, Zhen, et al.
Veröffentlicht: (2026)
von: Li, Zhen, et al.
Veröffentlicht: (2026)
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
von: Li, Ming, et al.
Veröffentlicht: (2025)
von: Li, Ming, et al.
Veröffentlicht: (2025)
Consistency of Compositional Generalization across Multiple Levels
von: Li, Chuanhao, et al.
Veröffentlicht: (2024)
von: Li, Chuanhao, et al.
Veröffentlicht: (2024)
PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
von: Mao, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Mao, Xiaofeng, et al.
Veröffentlicht: (2026)
SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
von: Li, Chuanhao, et al.
Veröffentlicht: (2024)
von: Li, Chuanhao, et al.
Veröffentlicht: (2024)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
von: Qiu, Yansheng, et al.
Veröffentlicht: (2025)
von: Qiu, Yansheng, et al.
Veröffentlicht: (2025)
LeX-Art: Rethinking Text Generation via Scalable High-Quality Data Synthesis
von: Zhao, Shitian, et al.
Veröffentlicht: (2025)
von: Zhao, Shitian, et al.
Veröffentlicht: (2025)
AI Idea Bench 2025: AI Research Idea Generation Benchmark
von: Qiu, Yansheng, et al.
Veröffentlicht: (2025)
von: Qiu, Yansheng, et al.
Veröffentlicht: (2025)
LaGen: Towards Autoregressive LiDAR Scene Generation
von: Zhou, Sizhuo, et al.
Veröffentlicht: (2025)
von: Zhou, Sizhuo, et al.
Veröffentlicht: (2025)
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
von: Xu, Zhaopan, et al.
Veröffentlicht: (2025)
von: Xu, Zhaopan, et al.
Veröffentlicht: (2025)
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
von: Li, Ming, et al.
Veröffentlicht: (2025)
von: Li, Ming, et al.
Veröffentlicht: (2025)
GeoRecon: Graph-Level Representation Learning for 3D Molecules via Reconstruction-Based Pretraining
von: Yan, Shaoheng, et al.
Veröffentlicht: (2025)
von: Yan, Shaoheng, et al.
Veröffentlicht: (2025)
Multi-Step Reasoning for Embodied Question Answering via Tool Augmentation
von: Zhai, Mingliang, et al.
Veröffentlicht: (2025)
von: Zhai, Mingliang, et al.
Veröffentlicht: (2025)
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
von: Xu, Zhaopan, et al.
Veröffentlicht: (2025)
von: Xu, Zhaopan, et al.
Veröffentlicht: (2025)
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
Moving toward best practice when using propensity score weighting in survey observational studies
von: Zeng, Yukang, et al.
Veröffentlicht: (2025)
von: Zeng, Yukang, et al.
Veröffentlicht: (2025)
GLEAM: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes
von: Chen, Xiao, et al.
Veröffentlicht: (2025)
von: Chen, Xiao, et al.
Veröffentlicht: (2025)
Axisymmetric self-similar solutions to the MHD equations without magnetic diffusion
von: Zhang, Shaoheng
Veröffentlicht: (2025)
von: Zhang, Shaoheng
Veröffentlicht: (2025)
Ähnliche Einträge
-
Closing the Expression Gap in LLM Instructions via Socratic Questioning
von: Sun, Jianwen, et al.
Veröffentlicht: (2025) -
From Pixels to Paths: A Multi-Agent Framework for Editable Scientific Illustration
von: Sun, Jianwen, et al.
Veröffentlicht: (2025) -
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
von: Sun, Jianwen, et al.
Veröffentlicht: (2025) -
MeepleLM: A Virtual Playtester Simulating Diverse Subjective Experiences
von: Li, Zizhen, et al.
Veröffentlicht: (2026) -
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
von: Ai, Jiaxin, et al.
Veröffentlicht: (2025)