Rethinking Visual Intelligence: Insights from Video Pretraining
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Acuaviva, Pablo, Davtyan, Aram, Hassan, Mariam, Stapf, Sebastian, Rahimi, Ahmad, Alahi, Alexandre, Favaro, Paolo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Predictive Modeling of Maritime Radar Data Using Transformer Architecture
par: Qesaraku, Bjorna, et autres
Publié: (2025)
par: Qesaraku, Bjorna, et autres
Publié: (2025)
WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery
par: Ayanzadeh, Aydin, et autres
Publié: (2026)
par: Ayanzadeh, Aydin, et autres
Publié: (2026)
Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection
par: Kang, Xueyang, et autres
Publié: (2026)
par: Kang, Xueyang, et autres
Publié: (2026)
Learning Sign Language Representation using CNN LSTM, 3DCNN, CNN RNN LSTM and CCN TD
par: Louison, Nikita, et autres
Publié: (2024)
par: Louison, Nikita, et autres
Publié: (2024)
Short-Window Sliding Learning for Real-Time Violence Detection via LLM-based Auto-Labeling
par: Jung, Seoik, et autres
Publié: (2025)
par: Jung, Seoik, et autres
Publié: (2025)
Tricks and Plug-ins for Gradient Boosting in Image Classification
par: Fang, Biyi, et autres
Publié: (2025)
par: Fang, Biyi, et autres
Publié: (2025)
Cooperative Perception: A Resource-Efficient Framework for Multi-Drone 3D Scene Reconstruction Using Federated Diffusion and NeRF
par: Pourmandi, Massoud
Publié: (2025)
par: Pourmandi, Massoud
Publié: (2025)
Method of UAV Inspection of Photovoltaic Modules Using Thermal and RGB Data Fusion
par: Lysyi, Andrii, et autres
Publié: (2025)
par: Lysyi, Andrii, et autres
Publié: (2025)
Scene Detection Policies and Keyframe Extraction Strategies for Large-Scale Video Analysis
par: Korolkov, Vasilii
Publié: (2025)
par: Korolkov, Vasilii
Publié: (2025)
A deep learning approach to track eye movements based on events
par: Seth, Chirag, et autres
Publié: (2025)
par: Seth, Chirag, et autres
Publié: (2025)
Point, Detect, Count: Multi-Task Medical Image Understanding with Instruction-Tuned Vision-Language Models
par: Gautam, Sushant, et autres
Publié: (2025)
par: Gautam, Sushant, et autres
Publié: (2025)
Image-based Facial Rig Inversion
par: Yang, Tianxiang, et autres
Publié: (2025)
par: Yang, Tianxiang, et autres
Publié: (2025)
A Landmark-Aware Visual Navigation Dataset
par: Johnson, Faith, et autres
Publié: (2024)
par: Johnson, Faith, et autres
Publié: (2024)
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
par: Yang, Baoyao, et autres
Publié: (2025)
par: Yang, Baoyao, et autres
Publié: (2025)
Objaverse++: Curated 3D Object Dataset with Quality Annotations
par: Lin, Chendi, et autres
Publié: (2025)
par: Lin, Chendi, et autres
Publié: (2025)
Polarization-Based Eye Tracking with Personalized Siamese Architectures
par: Kalkanli, Beyza, et autres
Publié: (2026)
par: Kalkanli, Beyza, et autres
Publié: (2026)
YOLOv10 with Kolmogorov-Arnold networks and vision-language foundation models for interpretable object detection and trustworthy multimodal AI in computer vision perception
par: Impraimakis, Marios, et autres
Publié: (2026)
par: Impraimakis, Marios, et autres
Publié: (2026)
The Geometry of Cortical Computation: Manifold Disentanglement and Predictive Dynamics in VCNet
par: Hill, Brennen A., et autres
Publié: (2025)
par: Hill, Brennen A., et autres
Publié: (2025)
Sat-JEPA-Diff: Bridging Self-Supervised Learning and Generative Diffusion for Remote Sensing
par: Komurcu, Kursat, et autres
Publié: (2026)
par: Komurcu, Kursat, et autres
Publié: (2026)
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025)
par: Cai, Weibin, et autres
Publié: (2025)
YOLO Ensemble for UAV-based Multispectral Defect Detection in Wind Turbine Components
par: Svystun, Serhii, et autres
Publié: (2025)
par: Svystun, Serhii, et autres
Publié: (2025)
ShapBPT: Image Feature Attributions Using Data-Aware Binary Partition Trees
par: Rashid, Muhammad, et autres
Publié: (2026)
par: Rashid, Muhammad, et autres
Publié: (2026)
Smelly, dense, and spreaded: The Object Detection for Olfactory References (ODOR) dataset
par: Zinnen, Mathias, et autres
Publié: (2025)
par: Zinnen, Mathias, et autres
Publié: (2025)
Attention Gathers, MLPs Compose: A Causal Analysis of an Action-Outcome Circuit in VideoViT
par: Chereddy, Sai V R
Publié: (2026)
par: Chereddy, Sai V R
Publié: (2026)
Semantic2Graph: Graph-based Multi-modal Feature Fusion for Action Segmentation in Videos
par: Zhang, Junbin, et autres
Publié: (2022)
par: Zhang, Junbin, et autres
Publié: (2022)
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
par: Viveiros, André G., et autres
Publié: (2025)
par: Viveiros, André G., et autres
Publié: (2025)
ARTPS: Depth-Enhanced Hybrid Anomaly Detection and Learnable Curiosity Score for Autonomous Rover Target Prioritization
par: Baydemir, Poyraz
Publié: (2025)
par: Baydemir, Poyraz
Publié: (2025)
μ-Net: A Deep Learning-Based Architecture for μ-CT Segmentation
par: Bruno, Pierangela, et autres
Publié: (2024)
par: Bruno, Pierangela, et autres
Publié: (2024)
TRACES: Temporal Recall with Contextual Embeddings for Real-Time Video Anomaly Detection
par: Siddiqui, Yousuf Ahmed, et autres
Publié: (2025)
par: Siddiqui, Yousuf Ahmed, et autres
Publié: (2025)
See What You Need: Query-Aware Visual Intelligence through Reasoning-Perception Loops
par: Dong, Zixuan, et autres
Publié: (2025)
par: Dong, Zixuan, et autres
Publié: (2025)
TGraphX: Tensor-Aware Graph Neural Network for Multi-Dimensional Feature Learning
par: Sajjadi, Arash, et autres
Publié: (2025)
par: Sajjadi, Arash, et autres
Publié: (2025)
Revisiting Energy-Based Model for Out-of-Distribution Detection
par: Wu, Yifan, et autres
Publié: (2024)
par: Wu, Yifan, et autres
Publié: (2024)
IMKD: Intensity-Aware Multi-Level Knowledge Distillation for Camera-Radar Fusion
par: Mishra, Shashank, et autres
Publié: (2025)
par: Mishra, Shashank, et autres
Publié: (2025)
Akasha 2: Hamiltonian State Space Duality and Visual-Language Joint Embedding Predictive Architectur
par: Meziani, Yani
Publié: (2026)
par: Meziani, Yani
Publié: (2026)
Heart Failure Prediction using Modal Decomposition and Masked Autoencoders for Scarce Echocardiography Databases
par: Bell-Navas, Andrés, et autres
Publié: (2025)
par: Bell-Navas, Andrés, et autres
Publié: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning
par: Patel, Urjitkumar, et autres
Publié: (2025)
par: Patel, Urjitkumar, et autres
Publié: (2025)
VDPP: Video Depth Post-Processing for Speed and Scalability
par: Yoon, Daewon, et autres
Publié: (2026)
par: Yoon, Daewon, et autres
Publié: (2026)
BG-YOLO: A Bidirectional-Guided Method for Underwater Object Detection
par: Zhang, Jian, et autres
Publié: (2024)
par: Zhang, Jian, et autres
Publié: (2024)
Learning Association via Track-Detection Matching for Multi-Object Tracking
par: Adžemović, Momir
Publié: (2025)
par: Adžemović, Momir
Publié: (2025)
Documents similaires
-
Predictive Modeling of Maritime Radar Data Using Transformer Architecture
par: Qesaraku, Bjorna, et autres
Publié: (2025) -
WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery
par: Ayanzadeh, Aydin, et autres
Publié: (2026) -
Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection
par: Kang, Xueyang, et autres
Publié: (2026) -
Learning Sign Language Representation using CNN LSTM, 3DCNN, CNN RNN LSTM and CCN TD
par: Louison, Nikita, et autres
Publié: (2024) -
Short-Window Sliding Learning for Real-Time Violence Detection via LLM-based Auto-Labeling
par: Jung, Seoik, et autres
Publié: (2025)