Enregistré dans:
| Auteurs principaux: | Gao, Shida, Xue, Feng, Wang, Xiangfeng, Ming, Anlong, Lin, Zhaowen, Zhang, Haiyang, Long, Teng, Sebe, Nicu, Shao, Yihua, Wang, Haozhe, Wang, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.06673 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Efficient Learning-based Solver Comparable to Metaheuristics for the Capacitated Arc Routing Problem
par: Guo, Runze, et autres
Publié: (2024)
par: Guo, Runze, et autres
Publié: (2024)
Cues3D: Unleashing the Power of Sole NeRF for Consistent and Unique Instances in Open-Vocabulary 3D Panoptic Segmentation
par: Xue, Feng, et autres
Publié: (2025)
par: Xue, Feng, et autres
Publié: (2025)
SM4Depth: Seamless Monocular Metric Depth Estimation across Multiple Cameras and Scenes by One Model
par: Liu, Yihao, et autres
Publié: (2024)
par: Liu, Yihao, et autres
Publié: (2024)
Open-World Deepfake Attribution via Confidence-Aware Asymmetric Learning
par: Zheng, Haiyang, et autres
Publié: (2025)
par: Zheng, Haiyang, et autres
Publié: (2025)
Indoor Obstacle Discovery on Reflective Ground via Monocular Camera
par: Xue, Feng, et autres
Publié: (2024)
par: Xue, Feng, et autres
Publié: (2024)
Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
AlignCAT: Visual-Linguistic Alignment of Category and Attribute for Weakly Supervised Visual Grounding
par: Wang, Yidan, et autres
Publié: (2025)
par: Wang, Yidan, et autres
Publié: (2025)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
par: Li, Jinlong, et autres
Publié: (2026)
par: Li, Jinlong, et autres
Publié: (2026)
The Devil Is in Gradient Entanglement: Energy-Aware Gradient Coordinator for Robust Generalized Category Discovery
par: Zheng, Haiyang, et autres
Publié: (2026)
par: Zheng, Haiyang, et autres
Publié: (2026)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
par: Meng, Jiahao, et autres
Publié: (2025)
par: Meng, Jiahao, et autres
Publié: (2025)
R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
par: Zhu, Lu, et autres
Publié: (2025)
par: Zhu, Lu, et autres
Publié: (2025)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
par: Lin, Xinying, et autres
Publié: (2026)
par: Lin, Xinying, et autres
Publié: (2026)
RankFeat&RankWeight: Rank-1 Feature/Weight Removal for Out-of-distribution Detection
par: Song, Yue, et autres
Publié: (2023)
par: Song, Yue, et autres
Publié: (2023)
H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
par: Zhang, Pingping, et autres
Publié: (2024)
par: Zhang, Pingping, et autres
Publié: (2024)
Asymmetric GANs for Image-to-Image Translation
par: Tang, Hao, et autres
Publié: (2019)
par: Tang, Hao, et autres
Publié: (2019)
Superpowering Open-Vocabulary Object Detectors for X-ray Vision
par: Garcia-Fernandez, Pablo, et autres
Publié: (2025)
par: Garcia-Fernandez, Pablo, et autres
Publié: (2025)
Risk-Aware World Model Predictive Control for Generalizable End-to-End Autonomous Driving
par: Sun, Jiangxin, et autres
Publié: (2026)
par: Sun, Jiangxin, et autres
Publié: (2026)
Prototypical Hash Encoding for On-the-Fly Fine-Grained Category Discovery
par: Zheng, Haiyang, et autres
Publié: (2024)
par: Zheng, Haiyang, et autres
Publié: (2024)
Generalized Fine-Grained Category Discovery with Multi-Granularity Conceptual Experts
par: Zheng, Haiyang, et autres
Publié: (2025)
par: Zheng, Haiyang, et autres
Publié: (2025)
Textual Knowledge Matters: Cross-Modality Co-Teaching for Generalized Visual Class Discovery
par: Zheng, Haiyang, et autres
Publié: (2024)
par: Zheng, Haiyang, et autres
Publié: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
par: Wasim, Syed Talal, et autres
Publié: (2023)
par: Wasim, Syed Talal, et autres
Publié: (2023)
Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos
par: Zuo, Zhi, et autres
Publié: (2025)
par: Zuo, Zhi, et autres
Publié: (2025)
Loomis Painter: Reconstructing the Painting Process
par: Pobitzer, Markus, et autres
Publié: (2025)
par: Pobitzer, Markus, et autres
Publié: (2025)
Rethinking the Learning Paradigm for Facial Expression Recognition
par: Wang, Weijie, et autres
Publié: (2022)
par: Wang, Weijie, et autres
Publié: (2022)
Efficient Traffic Prediction Through Spatio-Temporal Distillation
par: Zhang, Qianru, et autres
Publié: (2025)
par: Zhang, Qianru, et autres
Publié: (2025)
Discriminative Anchor Learning for Efficient Multi-view Clustering
par: Qin, Yalan, et autres
Publié: (2024)
par: Qin, Yalan, et autres
Publié: (2024)
Enhanced Multi-Scale Cross-Attention for Person Image Generation
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
Graph Transformer GANs with Graph Masked Modeling for Architectural Layout Generation
par: Tang, Hao, et autres
Publié: (2024)
par: Tang, Hao, et autres
Publié: (2024)
Event‐Triggered Distributed Secondary Control for Communication‐Efficient Frequency Restoration and Accurate Power Sharing in Islanded Microgrids
par: Anlong Yang, et autres
Publié: (2026)
par: Anlong Yang, et autres
Publié: (2026)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
par: Wang, Jiankang, et autres
Publié: (2025)
par: Wang, Jiankang, et autres
Publié: (2025)
Large Language Models for Multimodal Deformable Image Registration
par: Ma, Mingrui, et autres
Publié: (2024)
par: Ma, Mingrui, et autres
Publié: (2024)
Generate, Refine, and Encode: Leveraging Synthesized Novel Samples for On-the-Fly Fine-Grained Category Discovery
par: Liu, Xiao, et autres
Publié: (2025)
par: Liu, Xiao, et autres
Publié: (2025)
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
par: Zhuang, Weijun, et autres
Publié: (2026)
par: Zhuang, Weijun, et autres
Publié: (2026)
Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose Estimation
par: Li, Wenhao, et autres
Publié: (2023)
par: Li, Wenhao, et autres
Publié: (2023)
Context-Guided Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
CLIP is Strong Enough to Fight Back: Test-time Counterattacks towards Zero-shot Adversarial Robustness of CLIP
par: Xing, Songlong, et autres
Publié: (2025)
par: Xing, Songlong, et autres
Publié: (2025)
Hyperbolic Busemann Neural Networks
par: Chen, Ziheng, et autres
Publié: (2026)
par: Chen, Ziheng, et autres
Publié: (2026)
RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism
par: Peruzzo, Elia, et autres
Publié: (2025)
par: Peruzzo, Elia, et autres
Publié: (2025)
Phase Error Sensitivity to Injection Signals in Multi-Phase Injection-Locked Ring Oscillators
par: Wang, Zhaowen
Publié: (2025)
par: Wang, Zhaowen
Publié: (2025)
Documents similaires
-
An Efficient Learning-based Solver Comparable to Metaheuristics for the Capacitated Arc Routing Problem
par: Guo, Runze, et autres
Publié: (2024) -
Cues3D: Unleashing the Power of Sole NeRF for Consistent and Unique Instances in Open-Vocabulary 3D Panoptic Segmentation
par: Xue, Feng, et autres
Publié: (2025) -
SM4Depth: Seamless Monocular Metric Depth Estimation across Multiple Cameras and Scenes by One Model
par: Liu, Yihao, et autres
Publié: (2024) -
Open-World Deepfake Attribution via Confidence-Aware Asymmetric Learning
par: Zheng, Haiyang, et autres
Publié: (2025) -
Indoor Obstacle Discovery on Reflective Ground via Monocular Camera
par: Xue, Feng, et autres
Publié: (2024)