Research on World Models Is Not Merely Injecting World Knowledge into Specific Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Zeng, Bohan, Zhu, Kaixin, Hua, Daili, Li, Bozhou, Tong, Chengzhuo, Wang, Yuran, Huang, Xinyi, Dai, Yifan, Zhang, Zixiang, Yang, Yifan, Liu, Zhou, Liang, Hao, Ma, Xiaochen, An, Ruichuan, Bai, Tianyi, Gao, Hongcheng, Niu, Junbo, Shi, Yang, Chen, Xinlong, Ding, Yue, Shi, Minglei, Zeng, Kai, Tang, Yiwen, Zhang, Yuanxing, Wan, Pengfei, Wang, Xintao, Zhang, Wentao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OpenWorldLib: A Unified Codebase and Definition of Advanced World Models
por: DataFlow Team, et al.
Publicado: (2026)
por: DataFlow Team, et al.
Publicado: (2026)
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
por: Wang, Yuran, et al.
Publicado: (2025)
por: Wang, Yuran, et al.
Publicado: (2025)
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation
por: Tong, Chengzhuo, et al.
Publicado: (2026)
por: Tong, Chengzhuo, et al.
Publicado: (2026)
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
por: Li, Bozhou, et al.
Publicado: (2025)
por: Li, Bozhou, et al.
Publicado: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
por: Dai, Yifan, et al.
Publicado: (2026)
por: Dai, Yifan, et al.
Publicado: (2026)
The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
por: Li, Bozhou, et al.
Publicado: (2025)
por: Li, Bozhou, et al.
Publicado: (2025)
VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction
por: Zhu, Kaixin, et al.
Publicado: (2026)
por: Zhu, Kaixin, et al.
Publicado: (2026)
VABench: A Comprehensive Benchmark for Audio-Video Generation
por: Hua, Daili, et al.
Publicado: (2025)
por: Hua, Daili, et al.
Publicado: (2025)
EditWorld: Simulating World Dynamics for Instruction-Following Image Editing
por: Yang, Ling, et al.
Publicado: (2024)
por: Yang, Ling, et al.
Publicado: (2024)
Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
por: Tang, Yuqi, et al.
Publicado: (2026)
por: Tang, Yuqi, et al.
Publicado: (2026)
Semantic Routing: Exploring Multi-Layer LLM Feature Weighting for Diffusion Transformers
por: Li, Bozhou, et al.
Publicado: (2026)
por: Li, Bozhou, et al.
Publicado: (2026)
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
por: Chen, Xinlong, et al.
Publicado: (2026)
por: Chen, Xinlong, et al.
Publicado: (2026)
Semantic Score Distillation Sampling for Compositional Text-to-3D Generation
por: Yang, Ling, et al.
Publicado: (2024)
por: Yang, Ling, et al.
Publicado: (2024)
SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
por: Shi, Minglei, et al.
Publicado: (2025)
por: Shi, Minglei, et al.
Publicado: (2025)
ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models
por: Li, Bozhou, et al.
Publicado: (2025)
por: Li, Bozhou, et al.
Publicado: (2025)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
por: Shi, Yang, et al.
Publicado: (2025)
por: Shi, Yang, et al.
Publicado: (2025)
RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark
por: Shi, Yang, et al.
Publicado: (2025)
por: Shi, Yang, et al.
Publicado: (2025)
OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
por: Ding, Yue, et al.
Publicado: (2026)
por: Ding, Yue, et al.
Publicado: (2026)
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
por: Bai, Xuehai, et al.
Publicado: (2026)
por: Bai, Xuehai, et al.
Publicado: (2026)
WorldMem: Long-term Consistent World Simulation with Memory
por: Xiao, Zeqi, et al.
Publicado: (2025)
por: Xiao, Zeqi, et al.
Publicado: (2025)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
por: Liang, Hao, et al.
Publicado: (2025)
por: Liang, Hao, et al.
Publicado: (2025)
Towards Visual Query Localization in the 3D World
por: Peng, Liang, et al.
Publicado: (2026)
por: Peng, Liang, et al.
Publicado: (2026)
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
por: Zeng, Kai, et al.
Publicado: (2025)
por: Zeng, Kai, et al.
Publicado: (2025)
WideRange4D: Enabling High-Quality 4D Reconstruction with Wide-Range Movements and Scenes
por: Yang, Ling, et al.
Publicado: (2025)
por: Yang, Ling, et al.
Publicado: (2025)
Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
por: An, Ruichuan, et al.
Publicado: (2025)
por: An, Ruichuan, et al.
Publicado: (2025)
DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows
por: Liu, Zhou, et al.
Publicado: (2025)
por: Liu, Zhou, et al.
Publicado: (2025)
Trans4D: Realistic Geometry-Aware Transition for Compositional Text-to-4D Synthesis
por: Zeng, Bohan, et al.
Publicado: (2024)
por: Zeng, Bohan, et al.
Publicado: (2024)
Synthesis and Performance of Multifunctional Cobalt‐Doped Polydopamine‐Derived Carbon‐Based Electrocatalysts
por: Chengzhuo Xiao, et al.
Publicado: (2026)
por: Chengzhuo Xiao, et al.
Publicado: (2026)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
por: Liu, Tengfei, et al.
Publicado: (2026)
por: Liu, Tengfei, et al.
Publicado: (2026)
Pixels, Patterns, but No Poetry: To See The World like Humans
por: Gao, Hongcheng, et al.
Publicado: (2025)
por: Gao, Hongcheng, et al.
Publicado: (2025)
Derived logarithmic deformation theory and moduli stacks of derived logarithmic structures
por: Zhang, Ruichuan
Publicado: (2026)
por: Zhang, Ruichuan
Publicado: (2026)
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
$\text{C}^{2}\text{BNVAE}$: Dual-Conditional Deep Generation of Network Traffic Data for Network Intrusion Detection System Balancing
por: Zeng, Yifan
Publicado: (2025)
por: Zeng, Yifan
Publicado: (2025)
QuantMCP: Grounding Large Language Models in Verifiable Financial Reality
por: Zeng, Yifan
Publicado: (2025)
por: Zeng, Yifan
Publicado: (2025)
HistoLens: An LLM-Powered Framework for Multi-Layered Analysis of Historical Texts -- A Case Application of Yantie Lun
por: Zeng, Yifan
Publicado: (2024)
por: Zeng, Yifan
Publicado: (2024)
A Contrastive Federated Semi-Supervised Learning Intrusion Detection Framework for Internet of Robotic Things
por: Zeng, Yifan
Publicado: (2025)
por: Zeng, Yifan
Publicado: (2025)
CSAGC-IDS: A Dual-Module Deep Learning Network Intrusion Detection Model for Complex and Imbalanced Data
por: Zeng, Yifan
Publicado: (2025)
por: Zeng, Yifan
Publicado: (2025)
Step-Opt: Boosting Optimization Modeling in LLMs through Iterative Data Synthesis and Structured Validation
por: Wu, Yang, et al.
Publicado: (2025)
por: Wu, Yang, et al.
Publicado: (2025)
Web World Models
por: Feng, Jichen, et al.
Publicado: (2025)
por: Feng, Jichen, et al.
Publicado: (2025)
Ejemplares similares
-
OpenWorldLib: A Unified Codebase and Definition of Advanced World Models
por: DataFlow Team, et al.
Publicado: (2026) -
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
por: Wang, Yuran, et al.
Publicado: (2025) -
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation
por: Tong, Chengzhuo, et al.
Publicado: (2026) -
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
por: Li, Bozhou, et al.
Publicado: (2025) -
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
por: Dai, Yifan, et al.
Publicado: (2026)