Perception Test 2025: Challenge Summary and a Unified VQA Extension
Fuente:
arXiv
Salvato in:
| Autori principali: | Heyward, Joseph, Parthasarathy, Nikhil, Zhu, Tyler, Mahendran, Aravindh, Carreira, João, Damen, Dima, Zisserman, Andrew, Pătrăucean, Viorica |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark
di: Heyward, Joseph, et al.
Pubblicazione: (2024)
di: Heyward, Joseph, et al.
Pubblicazione: (2024)
Learning from Streaming Video with Orthogonal Gradients
di: Han, Tengda, et al.
Pubblicazione: (2025)
di: Han, Tengda, et al.
Pubblicazione: (2025)
Learning from One Continuous Video Stream
di: Carreira, João, et al.
Pubblicazione: (2023)
di: Carreira, João, et al.
Pubblicazione: (2023)
Unique Lives, Shared World: Learning from Single-Life Videos
di: Han, Tengda, et al.
Pubblicazione: (2025)
di: Han, Tengda, et al.
Pubblicazione: (2025)
Seeing without Pixels: Perception from Camera Trajectories
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
di: Perrett, Toby, et al.
Pubblicazione: (2024)
di: Perrett, Toby, et al.
Pubblicazione: (2024)
Recurrent Video Masked Autoencoders
di: Zoran, Daniel, et al.
Pubblicazione: (2025)
di: Zoran, Daniel, et al.
Pubblicazione: (2025)
A Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 Frames
di: Papalampidi, Pinelopi, et al.
Pubblicazione: (2023)
di: Papalampidi, Pinelopi, et al.
Pubblicazione: (2023)
TIM: A Time Interval Machine for Audio-Visual Action Recognition
di: Chalk, Jacob, et al.
Pubblicazione: (2024)
di: Chalk, Jacob, et al.
Pubblicazione: (2024)
Dynamic Reflections: Probing Video Representations with Text Alignment
di: Zhu, Tyler, et al.
Pubblicazione: (2025)
di: Zhu, Tyler, et al.
Pubblicazione: (2025)
Get a Grip: Reconstructing Hand-Object Stable Grasps in Egocentric Videos
di: Zhu, Zhifan, et al.
Pubblicazione: (2023)
di: Zhu, Zhifan, et al.
Pubblicazione: (2023)
LayerLock: Non-collapsing Representation Learning with Progressive Freezing
di: Erdogan, Goker, et al.
Pubblicazione: (2025)
di: Erdogan, Goker, et al.
Pubblicazione: (2025)
TAPVid-3D: A Benchmark for Tracking Any Point in 3D
di: Koppula, Skanda, et al.
Pubblicazione: (2024)
di: Koppula, Skanda, et al.
Pubblicazione: (2024)
TRecViT: A Recurrent Video Transformer
di: Pătrăucean, Viorica, et al.
Pubblicazione: (2024)
di: Pătrăucean, Viorica, et al.
Pubblicazione: (2024)
Token Cropr: Faster ViTs for Quite a Few Tasks
di: Bergner, Benjamin, et al.
Pubblicazione: (2024)
di: Bergner, Benjamin, et al.
Pubblicazione: (2024)
Scaling 4D Representations
di: Carreira, João, et al.
Pubblicazione: (2024)
di: Carreira, João, et al.
Pubblicazione: (2024)
BootsTAP: Bootstrapped Training for Tracking-Any-Point
di: Doersch, Carl, et al.
Pubblicazione: (2024)
di: Doersch, Carl, et al.
Pubblicazione: (2024)
Self-supervised video pretraining yields robust and more human-aligned visual representations
di: Parthasarathy, Nikhil, et al.
Pubblicazione: (2022)
di: Parthasarathy, Nikhil, et al.
Pubblicazione: (2022)
Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
Leveraging Modality Tags for Enhanced Cross-Modal Video Retrieval
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision
di: Bansal, Siddhant, et al.
Pubblicazione: (2024)
di: Bansal, Siddhant, et al.
Pubblicazione: (2024)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
The Invisible EgoHand: 3D Hand Forecasting through EgoBody Pose Estimation
di: Hatano, Masashi, et al.
Pubblicazione: (2025)
di: Hatano, Masashi, et al.
Pubblicazione: (2025)
The N-Body Problem: Parallel Execution from Single-Person Egocentric Video
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
Reconstructing Objects along Hand Interaction Timelines in Egocentric Video
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
Epic-Sounds: A Large-scale Dataset of Actions That Sound
di: Huh, Jaesung, et al.
Pubblicazione: (2023)
di: Huh, Jaesung, et al.
Pubblicazione: (2023)
Every Shot Counts: Using Exemplars for Repetition Counting in Videos
di: Sinha, Saptarshi, et al.
Pubblicazione: (2024)
di: Sinha, Saptarshi, et al.
Pubblicazione: (2024)
PointSt3R: Point Tracking through 3D Grounded Correspondence
di: Guerrier, Rhodri, et al.
Pubblicazione: (2025)
di: Guerrier, Rhodri, et al.
Pubblicazione: (2025)
AMEGO: Active Memory from long EGOcentric videos
di: Goletto, Gabriele, et al.
Pubblicazione: (2024)
di: Goletto, Gabriele, et al.
Pubblicazione: (2024)
Video Editing for Video Retrieval
di: Zhu, Bin, et al.
Pubblicazione: (2024)
di: Zhu, Bin, et al.
Pubblicazione: (2024)
EgoPoints: Advancing Point Tracking for Egocentric Videos
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
GenHowTo: Learning to Generate Actions and State Transformations from Instructional Videos
di: Souček, Tomáš, et al.
Pubblicazione: (2023)
di: Souček, Tomáš, et al.
Pubblicazione: (2023)
Segmenting Collision Sound Sources in Egocentric Videos
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
Personalizing Retrieval using Joint Embeddings or "the Return of Fluffy"
di: Korbar, Bruno, et al.
Pubblicazione: (2025)
di: Korbar, Bruno, et al.
Pubblicazione: (2025)
The Manga Whisperer: Automatically Generating Transcriptions for Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
Chirality in Action: Time-Aware Video Representation Learning by Latent Straightening
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
From Panels to Prose: Generating Literary Narratives from Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
Beyond Caption-Based Queries for Video Moment Retrieval
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
Adapting MLLMs for Nuanced Video Retrieval
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
CountGD++: Generalized Prompting for Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark
di: Heyward, Joseph, et al.
Pubblicazione: (2024) -
Learning from Streaming Video with Orthogonal Gradients
di: Han, Tengda, et al.
Pubblicazione: (2025) -
Learning from One Continuous Video Stream
di: Carreira, João, et al.
Pubblicazione: (2023) -
Unique Lives, Shared World: Learning from Single-Life Videos
di: Han, Tengda, et al.
Pubblicazione: (2025) -
Seeing without Pixels: Perception from Camera Trajectories
di: Xue, Zihui, et al.
Pubblicazione: (2025)