Wolf: Dense Video Captioning with a World Summarization Framework
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Boyi, Zhu, Ligeng, Tian, Ran, Tan, Shuhan, Chen, Yuxiao, Lu, Yao, Cui, Yin, Veer, Sushant, Ehrlich, Max, Philion, Jonah, Weng, Xinshuo, Xue, Fuzhao, Fan, Linxi, Zhu, Yuke, Kautz, Jan, Tao, Andrew, Liu, Ming-Yu, Fidler, Sanja, Ivanovic, Boris, Darrell, Trevor, Malik, Jitendra, Han, Song, Pavone, Marco |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Trajeglish: Traffic Modeling as Next-Token Prediction
por: Philion, Jonah, et al.
Publicado: (2023)
por: Philion, Jonah, et al.
Publicado: (2023)
Promptable Closed-loop Traffic Simulation
por: Tan, Shuhan, et al.
Publicado: (2024)
por: Tan, Shuhan, et al.
Publicado: (2024)
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
por: Gan, Yulu, et al.
Publicado: (2025)
por: Gan, Yulu, et al.
Publicado: (2025)
Driving Everywhere with Large Language Model Policy Adaptation
por: Li, Boyi, et al.
Publicado: (2024)
por: Li, Boyi, et al.
Publicado: (2024)
Tokenize the World into Object-level Knowledge to Address Long-tail Events in Autonomous Driving
por: Tian, Ran, et al.
Publicado: (2024)
por: Tian, Ran, et al.
Publicado: (2024)
QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation
por: Zhao, Yue, et al.
Publicado: (2025)
por: Zhao, Yue, et al.
Publicado: (2025)
The Case for Negative Data: From Crash Reports to Counterfactuals for Reasonable Driving
por: Patrikar, Jay, et al.
Publicado: (2025)
por: Patrikar, Jay, et al.
Publicado: (2025)
RealDrive: Retrieval-Augmented Driving with Diffusion Models
por: Ding, Wenhao, et al.
Publicado: (2025)
por: Ding, Wenhao, et al.
Publicado: (2025)
System-Level Safety Monitoring and Recovery for Perception Failures in Autonomous Vehicles
por: Chakraborty, Kaustav, et al.
Publicado: (2024)
por: Chakraborty, Kaustav, et al.
Publicado: (2024)
Sim-to-Real Reinforcement Learning for Vision-Based Dexterous Manipulation on Humanoids
por: Lin, Toru, et al.
Publicado: (2025)
por: Lin, Toru, et al.
Publicado: (2025)
Gen-Drive: Enhancing Diffusion Generative Driving Policies with Reward Modeling and Reinforcement Learning Fine-tuning
por: Huang, Zhiyu, et al.
Publicado: (2024)
por: Huang, Zhiyu, et al.
Publicado: (2024)
Describe Anything: Detailed Localized Image and Video Captioning
por: Lian, Long, et al.
Publicado: (2025)
por: Lian, Long, et al.
Publicado: (2025)
AMAGO: Scalable In-Context Reinforcement Learning for Adaptive Agents
por: Grigsby, Jake, et al.
Publicado: (2023)
por: Grigsby, Jake, et al.
Publicado: (2023)
Surprise Potential as a Measure of Interactivity in Driving Scenarios
por: Ding, Wenhao, et al.
Publicado: (2025)
por: Ding, Wenhao, et al.
Publicado: (2025)
RuleFuser: An Evidential Bayes Approach for Rule Injection in Imitation Learned Planners and Predictors for Robustness under Distribution Shifts
por: Patrikar, Jay, et al.
Publicado: (2024)
por: Patrikar, Jay, et al.
Publicado: (2024)
LoRD: Adapting Differentiable Driving Policies to Distribution Shifts
por: Diehl, Christopher, et al.
Publicado: (2024)
por: Diehl, Christopher, et al.
Publicado: (2024)
Online Aggregation of Trajectory Predictors
por: Tong, Alex, et al.
Publicado: (2025)
por: Tong, Alex, et al.
Publicado: (2025)
Safety Evaluation of Motion Plans Using Trajectory Predictors as Forward Reachable Set Estimators
por: Chakraborty, Kaustav, et al.
Publicado: (2025)
por: Chakraborty, Kaustav, et al.
Publicado: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
por: Chen, Yukang, et al.
Publicado: (2024)
por: Chen, Yukang, et al.
Publicado: (2024)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
por: Lian, Long, et al.
Publicado: (2023)
por: Lian, Long, et al.
Publicado: (2023)
Scaling Vision Pre-Training to 4K Resolution
por: Shi, Baifeng, et al.
Publicado: (2025)
por: Shi, Baifeng, et al.
Publicado: (2025)
Language-Image Models with 3D Understanding
por: Cho, Jang Hyun, et al.
Publicado: (2024)
por: Cho, Jang Hyun, et al.
Publicado: (2024)
Learning Humanoid Locomotion over Challenging Terrain
por: Radosavovic, Ilija, et al.
Publicado: (2024)
por: Radosavovic, Ilija, et al.
Publicado: (2024)
xT: Nested Tokenization for Larger Context in Large Images
por: Gupta, Ritwik, et al.
Publicado: (2024)
por: Gupta, Ritwik, et al.
Publicado: (2024)
DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy Planning in Autonomous Driving
por: Huang, Zhiyu, et al.
Publicado: (2023)
por: Huang, Zhiyu, et al.
Publicado: (2023)
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
por: Hirota, Yusuke, et al.
Publicado: (2025)
por: Hirota, Yusuke, et al.
Publicado: (2025)
DistillNeRF: Perceiving 3D Scenes from Single-Glance Images by Distilling Neural Fields and Foundation Model Features
por: Wang, Letian, et al.
Publicado: (2024)
por: Wang, Letian, et al.
Publicado: (2024)
Towards Efficient and Effective Multi-Camera Encoding for End-to-End Driving
por: Yang, Jiawei, et al.
Publicado: (2025)
por: Yang, Jiawei, et al.
Publicado: (2025)
DreamDrive: Generative 4D Scene Modeling from Street View Images
por: Mao, Jiageng, et al.
Publicado: (2024)
por: Mao, Jiageng, et al.
Publicado: (2024)
LoRA3D: Low-Rank Self-Calibration of 3D Geometric Foundation Models
por: Lu, Ziqi, et al.
Publicado: (2024)
por: Lu, Ziqi, et al.
Publicado: (2024)
ViR: Towards Efficient Vision Retention Backbones
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
Sim2Val: Leveraging Correlation Across Test Platforms for Variance-Reduced Metric Estimation
por: Luo, Rachel, et al.
Publicado: (2025)
por: Luo, Rachel, et al.
Publicado: (2025)
Align Your Flow: Scaling Continuous-Time Flow Map Distillation
por: Sabour, Amirmojtaba, et al.
Publicado: (2025)
por: Sabour, Amirmojtaba, et al.
Publicado: (2025)
Align Your Steps: Optimizing Sampling Schedules in Diffusion Models
por: Sabour, Amirmojtaba, et al.
Publicado: (2024)
por: Sabour, Amirmojtaba, et al.
Publicado: (2024)
LLM-grounded Video Diffusion Models
por: Lian, Long, et al.
Publicado: (2023)
por: Lian, Long, et al.
Publicado: (2023)
Accelerating Structured Chain-of-Thought in Autonomous Vehicles
por: Gu, Yi, et al.
Publicado: (2026)
por: Gu, Yi, et al.
Publicado: (2026)
Closed-Loop Supervised Fine-Tuning of Tokenized Traffic Models
por: Zhang, Zhejun, et al.
Publicado: (2024)
por: Zhang, Zhejun, et al.
Publicado: (2024)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
por: Wu, Tsung-Han, et al.
Publicado: (2024)
por: Wu, Tsung-Han, et al.
Publicado: (2024)
Latent Chain-of-Thought World Modeling for End-to-End Driving
por: Tan, Shuhan, et al.
Publicado: (2025)
por: Tan, Shuhan, et al.
Publicado: (2025)
VILA$^2$: VILA Augmented VILA
por: Fang, Yunhao, et al.
Publicado: (2024)
por: Fang, Yunhao, et al.
Publicado: (2024)
Ejemplares similares
-
Trajeglish: Traffic Modeling as Next-Token Prediction
por: Philion, Jonah, et al.
Publicado: (2023) -
Promptable Closed-loop Traffic Simulation
por: Tan, Shuhan, et al.
Publicado: (2024) -
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
por: Gan, Yulu, et al.
Publicado: (2025) -
Driving Everywhere with Large Language Model Policy Adaptation
por: Li, Boyi, et al.
Publicado: (2024) -
Tokenize the World into Object-level Knowledge to Address Long-tail Events in Autonomous Driving
por: Tian, Ran, et al.
Publicado: (2024)