Unique Lives, Shared World: Learning from Single-Life Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Tengda, Ebrahimi, Sayna, Gokay, Dilara, Ku, Li Yang, Ovsjanikov, Maks, Babukova, Iva, Zoran, Daniel, Patraucean, Viorica, Carreira, Joao, Zisserman, Andrew, Damen, Dima |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning from Streaming Video with Orthogonal Gradients
di: Han, Tengda, et al.
Pubblicazione: (2025)
di: Han, Tengda, et al.
Pubblicazione: (2025)
Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark
di: Heyward, Joseph, et al.
Pubblicazione: (2024)
di: Heyward, Joseph, et al.
Pubblicazione: (2024)
Dynamic Reflections: Probing Video Representations with Text Alignment
di: Zhu, Tyler, et al.
Pubblicazione: (2025)
di: Zhu, Tyler, et al.
Pubblicazione: (2025)
Learning from One Continuous Video Stream
di: Carreira, João, et al.
Pubblicazione: (2023)
di: Carreira, João, et al.
Pubblicazione: (2023)
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
di: Perrett, Toby, et al.
Pubblicazione: (2024)
di: Perrett, Toby, et al.
Pubblicazione: (2024)
Perception Test 2025: Challenge Summary and a Unified VQA Extension
di: Heyward, Joseph, et al.
Pubblicazione: (2026)
di: Heyward, Joseph, et al.
Pubblicazione: (2026)
Seeing without Pixels: Perception from Camera Trajectories
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
Frozen Forecasting: A Unified Evaluation
di: Walker, Jacob C, et al.
Pubblicazione: (2025)
di: Walker, Jacob C, et al.
Pubblicazione: (2025)
SciVid: Cross-Domain Evaluation of Video Models in Scientific Applications
di: Hasson, Yana, et al.
Pubblicazione: (2025)
di: Hasson, Yana, et al.
Pubblicazione: (2025)
Smoothed Graph Contrastive Learning via Seamless Proximity Integration
di: Behmanesh, Maysam, et al.
Pubblicazione: (2024)
di: Behmanesh, Maysam, et al.
Pubblicazione: (2024)
Shape Non-rigid Kinematics (SNK): A Zero-Shot Method for Non-Rigid Shape Matching via Unsupervised Functional Map Regularized Reconstruction
di: Attaiki, Souhaib, et al.
Pubblicazione: (2024)
di: Attaiki, Souhaib, et al.
Pubblicazione: (2024)
Memory-Scalable and Simplified Functional Map Learning
di: Magnet, Robin, et al.
Pubblicazione: (2024)
di: Magnet, Robin, et al.
Pubblicazione: (2024)
FILTR: Extracting Topological Features from Pretrained 3D Models
di: Martinez, Louis, et al.
Pubblicazione: (2026)
di: Martinez, Louis, et al.
Pubblicazione: (2026)
Recurrent Video Masked Autoencoders
di: Zoran, Daniel, et al.
Pubblicazione: (2025)
di: Zoran, Daniel, et al.
Pubblicazione: (2025)
Get a Grip: Reconstructing Hand-Object Stable Grasps in Egocentric Videos
di: Zhu, Zhifan, et al.
Pubblicazione: (2023)
di: Zhu, Zhifan, et al.
Pubblicazione: (2023)
TIM: A Time Interval Machine for Audio-Visual Action Recognition
di: Chalk, Jacob, et al.
Pubblicazione: (2024)
di: Chalk, Jacob, et al.
Pubblicazione: (2024)
Epic-Sounds: A Large-scale Dataset of Actions That Sound
di: Huh, Jaesung, et al.
Pubblicazione: (2023)
di: Huh, Jaesung, et al.
Pubblicazione: (2023)
CountGD: Multi-Modal Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
The N-Body Problem: Parallel Execution from Single-Person Egocentric Video
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
Generative Drifting is Secretly Score Matching: a Spectral and Variational Perspective
di: Turan, Erkan, et al.
Pubblicazione: (2026)
di: Turan, Erkan, et al.
Pubblicazione: (2026)
Self-Supervised Dual Contouring
di: Sundararaman, Ramana, et al.
Pubblicazione: (2024)
di: Sundararaman, Ramana, et al.
Pubblicazione: (2024)
FourieRF: Few-Shot NeRFs via Progressive Fourier Frequency Control
di: Gomez, Diego, et al.
Pubblicazione: (2025)
di: Gomez, Diego, et al.
Pubblicazione: (2025)
Back to 3D: Few-Shot 3D Keypoint Detection with Back-Projected 2D Features
di: Wimmer, Thomas, et al.
Pubblicazione: (2023)
di: Wimmer, Thomas, et al.
Pubblicazione: (2023)
Graph Alignment via Dual-Pass Spectral Encoding and Latent Space Communication
di: Behmanesh, Maysam, et al.
Pubblicazione: (2025)
di: Behmanesh, Maysam, et al.
Pubblicazione: (2025)
To Supervise or Not to Supervise: Understanding and Addressing the Key Challenges of Point Cloud Transfer Learning
di: Hadgi, Souhail, et al.
Pubblicazione: (2024)
di: Hadgi, Souhail, et al.
Pubblicazione: (2024)
Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
Leveraging Modality Tags for Enhanced Cross-Modal Video Retrieval
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
Every Shot Counts: Using Exemplars for Repetition Counting in Videos
di: Sinha, Saptarshi, et al.
Pubblicazione: (2024)
di: Sinha, Saptarshi, et al.
Pubblicazione: (2024)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
A Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 Frames
di: Papalampidi, Pinelopi, et al.
Pubblicazione: (2023)
di: Papalampidi, Pinelopi, et al.
Pubblicazione: (2023)
BootsTAP: Bootstrapped Training for Tracking-Any-Point
di: Doersch, Carl, et al.
Pubblicazione: (2024)
di: Doersch, Carl, et al.
Pubblicazione: (2024)
DiffuMatch: Category-Agnostic Spectral Diffusion Priors for Robust Non-rigid Shape Matching
di: Pierson, Emery, et al.
Pubblicazione: (2025)
di: Pierson, Emery, et al.
Pubblicazione: (2025)
PoNQ: a Neural QEM-based Mesh Representation
di: Maruani, Nissim, et al.
Pubblicazione: (2024)
di: Maruani, Nissim, et al.
Pubblicazione: (2024)
Reconstructing Objects along Hand Interaction Timelines in Egocentric Video
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
di: Zhu, Zhifan, et al.
Pubblicazione: (2025)
Video Editing for Video Retrieval
di: Zhu, Bin, et al.
Pubblicazione: (2024)
di: Zhu, Bin, et al.
Pubblicazione: (2024)
A Mixed Diet Makes DINO An Omnivorous Vision Encoder
di: Kabra, Rishabh, et al.
Pubblicazione: (2026)
di: Kabra, Rishabh, et al.
Pubblicazione: (2026)
How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals
di: Kumaran, Dharshan, et al.
Pubblicazione: (2026)
di: Kumaran, Dharshan, et al.
Pubblicazione: (2026)
Causal Evidence that Language Models use Confidence to Drive Behavior
di: Kumaran, Dharshan, et al.
Pubblicazione: (2026)
di: Kumaran, Dharshan, et al.
Pubblicazione: (2026)
Segmenting Collision Sound Sources in Egocentric Videos
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
EgoPoints: Advancing Point Tracking for Egocentric Videos
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Learning from Streaming Video with Orthogonal Gradients
di: Han, Tengda, et al.
Pubblicazione: (2025) -
Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark
di: Heyward, Joseph, et al.
Pubblicazione: (2024) -
Dynamic Reflections: Probing Video Representations with Text Alignment
di: Zhu, Tyler, et al.
Pubblicazione: (2025) -
Learning from One Continuous Video Stream
di: Carreira, João, et al.
Pubblicazione: (2023) -
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
di: Perrett, Toby, et al.
Pubblicazione: (2024)