Streaming Detection of Queried Event Start
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Eyzaguirre, Cristobal, Tang, Eric, Buch, Shyamal, Gaidon, Adrien, Wu, Jiajun, Niebles, Juan Carlos |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Linear Scaling Video VLMs for Long Video Understanding
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
Understanding Complexity in VideoQA via Visual Program Generation
par: Eyzaguirre, Cristobal, et autres
Publié: (2025)
par: Eyzaguirre, Cristobal, et autres
Publié: (2025)
Streaming Dense Video Captioning
par: Zhou, Xingyi, et autres
Publié: (2024)
par: Zhou, Xingyi, et autres
Publié: (2024)
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
par: Wysoczańska, Monika, et autres
Publié: (2025)
par: Wysoczańska, Monika, et autres
Publié: (2025)
Autoregressive Flow Matching for Motion Prediction
par: Xie, Johnathan, et autres
Publié: (2025)
par: Xie, Johnathan, et autres
Publié: (2025)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
par: Ye, Jinhui, et autres
Publié: (2025)
par: Ye, Jinhui, et autres
Publié: (2025)
Taming generative video models for zero-shot optical flow extraction
par: Kim, Seungwoo, et autres
Publié: (2025)
par: Kim, Seungwoo, et autres
Publié: (2025)
IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos
par: Liu, Yunong, et autres
Publié: (2024)
par: Liu, Yunong, et autres
Publié: (2024)
ReFiNe: Recursive Field Networks for Cross-modal Multi-scene Representation
par: Zakharov, Sergey, et autres
Publié: (2024)
par: Zakharov, Sergey, et autres
Publié: (2024)
Zero-Shot Multi-Object Scene Completion
par: Iwase, Shun, et autres
Publié: (2024)
par: Iwase, Shun, et autres
Publié: (2024)
OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World
par: Liu, Katherine, et autres
Publié: (2025)
par: Liu, Katherine, et autres
Publié: (2025)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
par: Min, Juhong, et autres
Publié: (2024)
par: Min, Juhong, et autres
Publié: (2024)
SurfPhase: 3D Interfacial Dynamics in Two-Phase Flows from Sparse Videos
par: Gao, Yue, et autres
Publié: (2026)
par: Gao, Yue, et autres
Publié: (2026)
Spot The Ball: A Benchmark for Visual Social Inference
par: Balamurugan, Neha, et autres
Publié: (2025)
par: Balamurugan, Neha, et autres
Publié: (2025)
Pairwise Discernment of AffectNet Expressions with ArcFace
par: Waldner, Dylan, et autres
Publié: (2024)
par: Waldner, Dylan, et autres
Publié: (2024)
Dual-Stream Attention with Multi-Modal Queries for Object Detection in Transportation Applications
par: Anwar, Noreen, et autres
Publié: (2025)
par: Anwar, Noreen, et autres
Publié: (2025)
Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets
par: Wu, Peng, et autres
Publié: (2026)
par: Wu, Peng, et autres
Publié: (2026)
AdaVid: Adaptive Video-Language Pretraining
par: Patel, Chaitanya, et autres
Publié: (2025)
par: Patel, Chaitanya, et autres
Publié: (2025)
NeRF-MAE: Masked AutoEncoders for Self-Supervised 3D Representation Learning for Neural Radiance Fields
par: Irshad, Muhammad Zubair, et autres
Publié: (2024)
par: Irshad, Muhammad Zubair, et autres
Publié: (2024)
QUEST: Query Stream for Practical Cooperative Perception
par: Fan, Siqi, et autres
Publié: (2023)
par: Fan, Siqi, et autres
Publié: (2023)
EvaGaussians: Event Stream Assisted Gaussian Splatting from Blurry Images
par: Yu, Wangbo, et autres
Publié: (2024)
par: Yu, Wangbo, et autres
Publié: (2024)
LayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer
par: Yu, Ning, et autres
Publié: (2022)
par: Yu, Ning, et autres
Publié: (2022)
Stream Query Denoising for Vectorized HD Map Construction
par: Wang, Shuo, et autres
Publié: (2024)
par: Wang, Shuo, et autres
Publié: (2024)
Bilateral Event Mining and Complementary for Event Stream Super-Resolution
par: Huang, Zhilin, et autres
Publié: (2024)
par: Huang, Zhilin, et autres
Publié: (2024)
EventGait: Towards Robust Gait Recognition with Event Streams
par: Xu, Senyan, et autres
Publié: (2026)
par: Xu, Senyan, et autres
Publié: (2026)
Hierarchical Point Attention for Indoor 3D Object Detection
par: Shu, Manli, et autres
Publié: (2023)
par: Shu, Manli, et autres
Publié: (2023)
Adaptive Event Stream Slicing for Open-Vocabulary Event-Based Object Detection via Vision-Language Knowledge Distillation
par: Zhang, Jinchang, et autres
Publié: (2025)
par: Zhang, Jinchang, et autres
Publié: (2025)
Understanding Video Transformers via Universal Concept Discovery
par: Kowal, Matthew, et autres
Publié: (2024)
par: Kowal, Matthew, et autres
Publié: (2024)
Scaling Dense Event-Stream Pretraining from Visual Foundation Models
par: Chen, Zhiwen, et autres
Publié: (2026)
par: Chen, Zhiwen, et autres
Publié: (2026)
EventGPT: Event Stream Understanding with Multimodal Large Language Models
par: Liu, Shaoyu, et autres
Publié: (2024)
par: Liu, Shaoyu, et autres
Publié: (2024)
EventTracer: Fast Path Tracing-based Event Stream Rendering
par: Li, Zhenyang, et autres
Publié: (2025)
par: Li, Zhenyang, et autres
Publié: (2025)
Event Voxel Set Transformer for Spatiotemporal Representation Learning on Event Streams
par: Xie, Bochen, et autres
Publié: (2023)
par: Xie, Bochen, et autres
Publié: (2023)
ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding
par: Xue, Le, et autres
Publié: (2023)
par: Xue, Le, et autres
Publié: (2023)
Zebrafish Counting Using Event Stream Data
par: Chen, Qianghua, et autres
Publié: (2025)
par: Chen, Qianghua, et autres
Publié: (2025)
StreamLTS: Query-based Temporal-Spatial LiDAR Fusion for Cooperative Object Detection
par: Yuan, Yunshuang, et autres
Publié: (2024)
par: Yuan, Yunshuang, et autres
Publié: (2024)
GS2E: Gaussian Splatting is an Effective Data Generator for Event Stream Generation
par: Li, Yuchen, et autres
Publié: (2025)
par: Li, Yuchen, et autres
Publié: (2025)
RayFormer: Improving Query-Based Multi-Camera 3D Object Detection via Ray-Centric Strategies
par: Chu, Xiaomeng, et autres
Publié: (2024)
par: Chu, Xiaomeng, et autres
Publié: (2024)
RaCFormer: Towards High-Quality 3D Object Detection via Query-based Radar-Camera Fusion
par: Chu, Xiaomeng, et autres
Publié: (2024)
par: Chu, Xiaomeng, et autres
Publié: (2024)
Knowledge Distillation via Query Selection for Detection Transformer
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation
par: Patel, Chaitanya, et autres
Publié: (2025)
par: Patel, Chaitanya, et autres
Publié: (2025)
Documents similaires
-
Linear Scaling Video VLMs for Long Video Understanding
par: Eyzaguirre, Cristobal, et autres
Publié: (2026) -
Understanding Complexity in VideoQA via Visual Program Generation
par: Eyzaguirre, Cristobal, et autres
Publié: (2025) -
Streaming Dense Video Captioning
par: Zhou, Xingyi, et autres
Publié: (2024) -
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
par: Wysoczańska, Monika, et autres
Publié: (2025) -
Autoregressive Flow Matching for Motion Prediction
par: Xie, Johnathan, et autres
Publié: (2025)