Enregistré dans:
| Auteurs principaux: | Zhao, Chen, Liu, Shuming, Mangalam, Karttikeya, Qian, Guocheng, Zohra, Fatimah, Alghannam, Abdulmohsen, Malik, Jitendra, Ghanem, Bernard |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2401.04105 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Human Trajectory Prediction via Latent Corridors
par: Thakkar, Neerja, et autres
Publié: (2023)
par: Thakkar, Neerja, et autres
Publié: (2023)
xT: Nested Tokenization for Larger Context in Large Images
par: Gupta, Ritwik, et autres
Publié: (2024)
par: Gupta, Ritwik, et autres
Publié: (2024)
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
par: Zohra, Fatimah, et autres
Publié: (2025)
par: Zohra, Fatimah, et autres
Publié: (2025)
Pix4Point: Image Pretrained Standard Transformers for 3D Point Cloud Understanding
par: Qian, Guocheng, et autres
Publié: (2022)
par: Qian, Guocheng, et autres
Publié: (2022)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
par: Liu, Shuming, et autres
Publié: (2025)
par: Liu, Shuming, et autres
Publié: (2025)
ColorMAE: Exploring data-independent masking strategies in Masked AutoEncoders
par: Hinojosa, Carlos, et autres
Publié: (2024)
par: Hinojosa, Carlos, et autres
Publié: (2024)
End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames
par: Liu, Shuming, et autres
Publié: (2023)
par: Liu, Shuming, et autres
Publié: (2023)
OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection
par: Liu, Shuming, et autres
Publié: (2025)
par: Liu, Shuming, et autres
Publié: (2025)
Mist: Efficient Distributed Training of Large Language Models via Memory-Parallelism Co-Optimization
par: Zhu, Zhanda, et autres
Publié: (2025)
par: Zhu, Zhanda, et autres
Publié: (2025)
GES: Generalized Exponential Splatting for Efficient Radiance Field Rendering
par: Hamdi, Abdullah, et autres
Publié: (2024)
par: Hamdi, Abdullah, et autres
Publié: (2024)
ResidualViT for Efficient Temporally Dense Video Encoding
par: Soldan, Mattia, et autres
Publié: (2025)
par: Soldan, Mattia, et autres
Publié: (2025)
Harnessing Temporal Causality for Advanced Temporal Action Detection
par: Liu, Shuming, et autres
Publié: (2024)
par: Liu, Shuming, et autres
Publié: (2024)
Video Self-Stitching Graph Network for Temporal Action Localization
par: Zhao, Chen, et autres
Publié: (2020)
par: Zhao, Chen, et autres
Publié: (2020)
Re-evaluating the Need for Multimodal Signals in Unsupervised Grammar Induction
par: Li, Boyi, et autres
Publié: (2022)
par: Li, Boyi, et autres
Publié: (2022)
EasyV2V: A High-quality Instruction-based Video Editing Framework
par: Mai, Jinjie, et autres
Publié: (2025)
par: Mai, Jinjie, et autres
Publié: (2025)
TrackNeRF: Bundle Adjusting NeRF from Sparse and Noisy Views via Feature Tracks
par: Mai, Jinjie, et autres
Publié: (2024)
par: Mai, Jinjie, et autres
Publié: (2024)
TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos
par: Zhang, Chen-Lin, et autres
Publié: (2025)
par: Zhang, Chen-Lin, et autres
Publié: (2025)
Do Vision and Language Encoders Represent the World Similarly?
par: Maniparambil, Mayug, et autres
Publié: (2024)
par: Maniparambil, Mayug, et autres
Publié: (2024)
GoTTA be Diverse: Rethinking Memory Policies for Test-Time Adaptation
par: Alhuwaider, Shyma, et autres
Publié: (2026)
par: Alhuwaider, Shyma, et autres
Publié: (2026)
SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries
par: Mkhallati, Hassan, et autres
Publié: (2023)
par: Mkhallati, Hassan, et autres
Publié: (2023)
SPAD : Spatially Aware Multiview Diffusers
par: Kant, Yash, et autres
Publié: (2024)
par: Kant, Yash, et autres
Publié: (2024)
Human-level 3D shape perception emerges from multi-view learning
par: Bonnen, Tyler, et autres
Publié: (2026)
par: Bonnen, Tyler, et autres
Publié: (2026)
DRSI-Net: Dual-Residual Spatial Interaction Network for Multi-Person Pose Estimation
par: Wu, Shang, et autres
Publié: (2024)
par: Wu, Shang, et autres
Publié: (2024)
ADVMEM: Adversarial Memory Initialization for Realistic Test-Time Adaptation via Tracklet-Based Benchmarking
par: Alhuwaider, Shyma, et autres
Publié: (2025)
par: Alhuwaider, Shyma, et autres
Publié: (2025)
DPE-Net: Dual-Parallel Encoder Based Network for Semantic Segmentation of Polyps
par: Manan, Malik Abdul, et autres
Publié: (2024)
par: Manan, Malik Abdul, et autres
Publié: (2024)
Dynamically Masked Discriminator for Generative Adversarial Networks
par: Zhang, Wentian, et autres
Publié: (2023)
par: Zhang, Wentian, et autres
Publié: (2023)
MambaStyle: Efficient StyleGAN Inversion for Real Image Editing with State-Space Models
par: Lopez, Jhon, et autres
Publié: (2025)
par: Lopez, Jhon, et autres
Publié: (2025)
SMILE: Infusing Spatial and Motion Semantics in Masked Video Learning
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
Reconstructing Hand-Held Objects in 3D from Images and Videos
par: Wu, Jane, et autres
Publié: (2024)
par: Wu, Jane, et autres
Publié: (2024)
SPARF: Large-Scale Learning of 3D Sparse Radiance Fields from Few Input Images
par: Hamdi, Abdullah, et autres
Publié: (2022)
par: Hamdi, Abdullah, et autres
Publié: (2022)
Hybrid Structure-from-Motion and Camera Relocalization for Enhanced Egocentric Localization
par: Mai, Jinjie, et autres
Publié: (2024)
par: Mai, Jinjie, et autres
Publié: (2024)
DeGMix: Efficient Multi-Task Dense Prediction with Deformable and Gating Mixer
par: Xu, Yangyang, et autres
Publié: (2023)
par: Xu, Yangyang, et autres
Publié: (2023)
SoccerNet-Tracking: Multiple Object Tracking Dataset and Benchmark in Soccer Videos
par: Cioppa, Anthony, et autres
Publié: (2022)
par: Cioppa, Anthony, et autres
Publié: (2022)
SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues
par: Hinojosa, Carlos, et autres
Publié: (2026)
par: Hinojosa, Carlos, et autres
Publié: (2026)
Scaling Properties of Diffusion Models for Perceptual Tasks
par: Ravishankar, Rahul, et autres
Publié: (2024)
par: Ravishankar, Rahul, et autres
Publié: (2024)
Rodrigues Network for Learning Robot Actions
par: Zhang, Jialiang, et autres
Publié: (2025)
par: Zhang, Jialiang, et autres
Publié: (2025)
Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation
par: Eldesokey, Abdelrahman, et autres
Publié: (2025)
par: Eldesokey, Abdelrahman, et autres
Publié: (2025)
Exploring Missing Modality in Multimodal Egocentric Datasets
par: Ramazanova, Merey, et autres
Publié: (2024)
par: Ramazanova, Merey, et autres
Publié: (2024)
Test-Time Adaptation for Combating Missing Modalities in Egocentric Videos
par: Ramazanova, Merey, et autres
Publié: (2024)
par: Ramazanova, Merey, et autres
Publié: (2024)
Tracking by Predicting 3-D Gaussians Over Time
par: Baranwal, Tanish, et autres
Publié: (2025)
par: Baranwal, Tanish, et autres
Publié: (2025)
Documents similaires
-
Adaptive Human Trajectory Prediction via Latent Corridors
par: Thakkar, Neerja, et autres
Publié: (2023) -
xT: Nested Tokenization for Larger Context in Large Images
par: Gupta, Ritwik, et autres
Publié: (2024) -
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
par: Zohra, Fatimah, et autres
Publié: (2025) -
Pix4Point: Image Pretrained Standard Transformers for 3D Point Cloud Understanding
par: Qian, Guocheng, et autres
Publié: (2022) -
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
par: Liu, Shuming, et autres
Publié: (2025)