AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Chai, Wenhao, Song, Enxin, Du, Yilun, Meng, Chenlin, Madhavan, Vashisht, Bar-Tal, Omer, Hwang, Jenq-Neng, Xie, Saining, Manning, Christopher D. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
by: Song, Enxin, et al.
Published: (2024)
by: Song, Enxin, et al.
Published: (2024)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
by: Xu, Weili, et al.
Published: (2025)
by: Xu, Weili, et al.
Published: (2025)
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
by: Song, Enxin, et al.
Published: (2025)
by: Song, Enxin, et al.
Published: (2025)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
by: Song, Enxin, et al.
Published: (2023)
by: Song, Enxin, et al.
Published: (2023)
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
by: Cheng, Kanzhi, et al.
Published: (2025)
by: Cheng, Kanzhi, et al.
Published: (2025)
SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory
by: Yang, Cheng-Yen, et al.
Published: (2024)
by: Yang, Cheng-Yen, et al.
Published: (2024)
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
by: Huang, Hsiang-Wei, et al.
Published: (2024)
by: Huang, Hsiang-Wei, et al.
Published: (2024)
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
by: Hu, Wenhao, et al.
Published: (2025)
by: Hu, Wenhao, et al.
Published: (2025)
ToSA: Token Merging with Spatial Awareness
by: Huang, Hsiang-Wei, et al.
Published: (2025)
by: Huang, Hsiang-Wei, et al.
Published: (2025)
UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
by: Jiang, Zhongyu, et al.
Published: (2025)
by: Jiang, Zhongyu, et al.
Published: (2025)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
by: Wu, Peiran, et al.
Published: (2025)
by: Wu, Peiran, et al.
Published: (2025)
PackDiT: Joint Human Motion and Text Generation via Mutual Prompting
by: Jiang, Zhongyu, et al.
Published: (2025)
by: Jiang, Zhongyu, et al.
Published: (2025)
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
by: Zhang, Zhenyu, et al.
Published: (2023)
by: Zhang, Zhenyu, et al.
Published: (2023)
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
by: Wang, Gaoang, et al.
Published: (2022)
by: Wang, Gaoang, et al.
Published: (2022)
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
by: Zhong, Chunlin, et al.
Published: (2025)
by: Zhong, Chunlin, et al.
Published: (2025)
CityGen: Infinite and Controllable City Layout Generation
by: Deng, Jie, et al.
Published: (2023)
by: Deng, Jie, et al.
Published: (2023)
VideoNSA: Native Sparse Attention Scales Video Understanding
by: Song, Enxin, et al.
Published: (2025)
by: Song, Enxin, et al.
Published: (2025)
Reasoning Matters for 3D Visual Grounding
by: Huang, Hsiang-Wei, et al.
Published: (2026)
by: Huang, Hsiang-Wei, et al.
Published: (2026)
EVAN: Evolutional Video Streaming Adaptation via Neural Representation
by: Liu, Mufan, et al.
Published: (2024)
by: Liu, Mufan, et al.
Published: (2024)
DynVFX: Augmenting Real Videos with Dynamic Content
by: Yatim, Danah, et al.
Published: (2025)
by: Yatim, Danah, et al.
Published: (2025)
RT-Pose: A 4D Radar Tensor-based 3D Human Pose Estimation and Localization Benchmark
by: Ho, Yuan-Hao, et al.
Published: (2024)
by: Ho, Yuan-Hao, et al.
Published: (2024)
DistillKac: Few-Step Image Generation via Damped Wave Equations
by: Han, Weiqiao, et al.
Published: (2025)
by: Han, Weiqiao, et al.
Published: (2025)
Benchmarking and Improving Detail Image Caption
by: Dong, Hongyuan, et al.
Published: (2024)
by: Dong, Hongyuan, et al.
Published: (2024)
DAug: Diffusion-based Channel Augmentation for Radiology Image Retrieval and Classification
by: Jin, Ying, et al.
Published: (2024)
by: Jin, Ying, et al.
Published: (2024)
Understanding Identity Continuity in Thermal Video through Scene-Level Consistency
by: Sun, Wei-Chieh, et al.
Published: (2026)
by: Sun, Wei-Chieh, et al.
Published: (2026)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
by: Chen, Xinlong, et al.
Published: (2025)
by: Chen, Xinlong, et al.
Published: (2025)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
by: Meng, Desen, et al.
Published: (2025)
by: Meng, Desen, et al.
Published: (2025)
Video Streaming with Kairos: An MPC-Based ABR with Streaming-Aware Throughput Prediction
by: Zhong, Ziyu, et al.
Published: (2025)
by: Zhong, Ziyu, et al.
Published: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
by: Islam, Md Mohaiminul, et al.
Published: (2024)
by: Islam, Md Mohaiminul, et al.
Published: (2024)
ProTPS: Prototype-Guided Text Prompt Selection for Continual Learning
by: Mei, Jie, et al.
Published: (2026)
by: Mei, Jie, et al.
Published: (2026)
Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression
by: Li, Kunjun, et al.
Published: (2025)
by: Li, Kunjun, et al.
Published: (2025)
SnapCap: Efficient Snapshot Compressive Video Captioning
by: Sun, Jianqiao, et al.
Published: (2024)
by: Sun, Jianqiao, et al.
Published: (2024)
VersaT2I: Improving Text-to-Image Models with Versatile Reward
by: Guo, Jianshu, et al.
Published: (2024)
by: Guo, Jianshu, et al.
Published: (2024)
VideoSketcher: Video Models Prior Enable Versatile Sequential Sketch Generation
by: Ren, Hui, et al.
Published: (2026)
by: Ren, Hui, et al.
Published: (2026)
Describe Anything: Detailed Localized Image and Video Captioning
by: Lian, Long, et al.
Published: (2025)
by: Lian, Long, et al.
Published: (2025)
A Density-Guided Temporal Attention Transformer for Indiscernible Object Counting in Underwater Video
by: Yang, Cheng-Yen, et al.
Published: (2024)
by: Yang, Cheng-Yen, et al.
Published: (2024)
The diffusivity of supercritical Bernoulli percolation is infinitely differentiable
by: Gu, Chenlin, et al.
Published: (2025)
by: Gu, Chenlin, et al.
Published: (2025)
IF-VidCap: Can Video Caption Models Follow Instructions?
by: Li, Shihao, et al.
Published: (2025)
by: Li, Shihao, et al.
Published: (2025)
Cap2Sum: Learning to Summarize Videos by Generating Captions
by: Zhao, Cairong, et al.
Published: (2024)
by: Zhao, Cairong, et al.
Published: (2024)
Attention Consistency for LLMs Explanation
by: Lan, Tian, et al.
Published: (2025)
by: Lan, Tian, et al.
Published: (2025)
Similar Items
-
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
by: Song, Enxin, et al.
Published: (2024) -
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
by: Xu, Weili, et al.
Published: (2025) -
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
by: Song, Enxin, et al.
Published: (2025) -
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
by: Song, Enxin, et al.
Published: (2023) -
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
by: Cheng, Kanzhi, et al.
Published: (2025)