TIM: A Time Interval Machine for Audio-Visual Action Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Chalk, Jacob, Huh, Jaesung, Kazakos, Evangelos, Zisserman, Andrew, Damen, Dima |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Epic-Sounds: A Large-scale Dataset of Actions That Sound
di: Huh, Jaesung, et al.
Pubblicazione: (2023)
di: Huh, Jaesung, et al.
Pubblicazione: (2023)
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
di: Korbar, Bruno, et al.
Pubblicazione: (2024)
di: Korbar, Bruno, et al.
Pubblicazione: (2024)
Character-aware audio-visual subtitling in context
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
di: Perrett, Toby, et al.
Pubblicazione: (2024)
di: Perrett, Toby, et al.
Pubblicazione: (2024)
Seeing without Pixels: Perception from Camera Trajectories
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
Spatial Cognition from Egocentric Video: Out of Sight, Not Out of Mind
di: Plizzari, Chiara, et al.
Pubblicazione: (2024)
di: Plizzari, Chiara, et al.
Pubblicazione: (2024)
Prime and Reach: Synthesising Body Motion for Gaze-Primed Object Reach
di: Hatano, Masashi, et al.
Pubblicazione: (2025)
di: Hatano, Masashi, et al.
Pubblicazione: (2025)
Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark
di: Heyward, Joseph, et al.
Pubblicazione: (2024)
di: Heyward, Joseph, et al.
Pubblicazione: (2024)
Get a Grip: Reconstructing Hand-Object Stable Grasps in Egocentric Videos
di: Zhu, Zhifan, et al.
Pubblicazione: (2023)
di: Zhu, Zhifan, et al.
Pubblicazione: (2023)
Chirality in Action: Time-Aware Video Representation Learning by Latent Straightening
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
Perception Test 2025: Challenge Summary and a Unified VQA Extension
di: Heyward, Joseph, et al.
Pubblicazione: (2026)
di: Heyward, Joseph, et al.
Pubblicazione: (2026)
Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
Large-scale Pre-training for Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
GenHowTo: Learning to Generate Actions and State Transformations from Instructional Videos
di: Souček, Tomáš, et al.
Pubblicazione: (2023)
di: Souček, Tomáš, et al.
Pubblicazione: (2023)
HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision
di: Bansal, Siddhant, et al.
Pubblicazione: (2024)
di: Bansal, Siddhant, et al.
Pubblicazione: (2024)
Leveraging Modality Tags for Enhanced Cross-Modal Video Retrieval
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
Learning from Streaming Video with Orthogonal Gradients
di: Han, Tengda, et al.
Pubblicazione: (2025)
di: Han, Tengda, et al.
Pubblicazione: (2025)
PointSt3R: Point Tracking through 3D Grounded Correspondence
di: Guerrier, Rhodri, et al.
Pubblicazione: (2025)
di: Guerrier, Rhodri, et al.
Pubblicazione: (2025)
ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions
di: Souček, Tomáš, et al.
Pubblicazione: (2024)
di: Souček, Tomáš, et al.
Pubblicazione: (2024)
AMEGO: Active Memory from long EGOcentric videos
di: Goletto, Gabriele, et al.
Pubblicazione: (2024)
di: Goletto, Gabriele, et al.
Pubblicazione: (2024)
The Invisible EgoHand: 3D Hand Forecasting through EgoBody Pose Estimation
di: Hatano, Masashi, et al.
Pubblicazione: (2025)
di: Hatano, Masashi, et al.
Pubblicazione: (2025)
The N-Body Problem: Parallel Execution from Single-Person Egocentric Video
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
Reconstructing Objects along Hand Interaction Timelines in Egocentric Video
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
Every Shot Counts: Using Exemplars for Repetition Counting in Videos
di: Sinha, Saptarshi, et al.
Pubblicazione: (2024)
di: Sinha, Saptarshi, et al.
Pubblicazione: (2024)
Noise-Tolerant Learning for Audio-Visual Action Recognition
di: Han, Haochen, et al.
Pubblicazione: (2022)
di: Han, Haochen, et al.
Pubblicazione: (2022)
EgoPoints: Advancing Point Tracking for Egocentric Videos
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
Unique Lives, Shared World: Learning from Single-Life Videos
di: Han, Tengda, et al.
Pubblicazione: (2025)
di: Han, Tengda, et al.
Pubblicazione: (2025)
The Manga Whisperer: Automatically Generating Transcriptions for Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
Personalizing Retrieval using Joint Embeddings or "the Return of Fluffy"
di: Korbar, Bruno, et al.
Pubblicazione: (2025)
di: Korbar, Bruno, et al.
Pubblicazione: (2025)
From Panels to Prose: Generating Literary Narratives from Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
Beyond Caption-Based Queries for Video Moment Retrieval
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
di: Xie, Junyu, et al.
Pubblicazione: (2026)
di: Xie, Junyu, et al.
Pubblicazione: (2026)
CountGD++: Generalized Prompting for Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
Semi-Supervised Audio-Visual Video Action Recognition with Audio Source Localization Guided Mixup
di: Kang, Seokun, et al.
Pubblicazione: (2025)
di: Kang, Seokun, et al.
Pubblicazione: (2025)
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
di: Xie, Junyu, et al.
Pubblicazione: (2024)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
Learning from One Continuous Video Stream
di: Carreira, João, et al.
Pubblicazione: (2023)
di: Carreira, João, et al.
Pubblicazione: (2023)
WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata
di: Sridhar, Prasanna, et al.
Pubblicazione: (2026)
di: Sridhar, Prasanna, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Epic-Sounds: A Large-scale Dataset of Actions That Sound
di: Huh, Jaesung, et al.
Pubblicazione: (2023) -
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
di: Korbar, Bruno, et al.
Pubblicazione: (2024) -
Character-aware audio-visual subtitling in context
di: Huh, Jaesung, et al.
Pubblicazione: (2024) -
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
di: Perrett, Toby, et al.
Pubblicazione: (2024) -
Seeing without Pixels: Perception from Camera Trajectories
di: Xue, Zihui, et al.
Pubblicazione: (2025)