Enregistré dans:
| Auteurs principaux: | Hu, Xinyi, Wang, Yuran, Zhang, Ruixu, Li, Yue, Liu, Wenxuan, Wang, Zheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.20189 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond the Individual: Introducing Group Intention Forecasting with SHOT Dataset
par: Zhang, Ruixu, et autres
Publié: (2025)
par: Zhang, Ruixu, et autres
Publié: (2025)
Anomize: Better Open Vocabulary Video Anomaly Detection
par: Li, Fei, et autres
Publié: (2025)
par: Li, Fei, et autres
Publié: (2025)
Towards Dense and Accurate Radar Perception Via Efficient Cross-Modal Diffusion Model
par: Zhang, Ruibin, et autres
Publié: (2024)
par: Zhang, Ruibin, et autres
Publié: (2024)
Uncertainty-Aware Token Importance Estimation in Spiking Transformers
par: Liu, Wenxuan, et autres
Publié: (2026)
par: Liu, Wenxuan, et autres
Publié: (2026)
Beyond Literal Descriptions: Understanding and Locating Open-World Objects Aligned with Human Intentions
par: Wang, Wenxuan, et autres
Publié: (2024)
par: Wang, Wenxuan, et autres
Publié: (2024)
Devil is in Details: Locality-Aware 3D Abdominal CT Volume Generation for Self-Supervised Organ Segmentation
par: Wang, Yuran, et autres
Publié: (2024)
par: Wang, Yuran, et autres
Publié: (2024)
SPAN: Spatial-Projection Alignment for Monocular 3D Object Detection
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
IFNet: Deep Imaging and Focusing for Handheld SAR with Millimeter-wave Signals
par: Li, Yadong, et autres
Publié: (2024)
par: Li, Yadong, et autres
Publié: (2024)
Bidirectional Progressive Transformer for Interaction Intention Anticipation
par: Zhang, Zichen, et autres
Publié: (2024)
par: Zhang, Zichen, et autres
Publié: (2024)
RobuSTereo: Robust Zero-Shot Stereo Matching under Adverse Weather
par: Wang, Yuran, et autres
Publié: (2025)
par: Wang, Yuran, et autres
Publié: (2025)
SPAN: Learning Similarity between Scene Graphs and Images with Transformers
par: Cong, Yuren, et autres
Publié: (2023)
par: Cong, Yuren, et autres
Publié: (2023)
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
par: Wang, Yuran, et autres
Publié: (2025)
par: Wang, Yuran, et autres
Publié: (2025)
Weakly-Supervised Temporal Action Localization by Progressive Complementary Learning
par: Du, Jia-Run, et autres
Publié: (2022)
par: Du, Jia-Run, et autres
Publié: (2022)
IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning
par: Qiu, Tianheng, et autres
Publié: (2025)
par: Qiu, Tianheng, et autres
Publié: (2025)
Passive Non-Line-of-Sight Imaging with Light Transport Modulation
par: Zhang, Jiarui, et autres
Publié: (2023)
par: Zhang, Jiarui, et autres
Publié: (2023)
Beyond Single Models: Mitigating Multimodal Hallucinations via Adaptive Token Ensemble Decoding
par: Li, Jinlin, et autres
Publié: (2025)
par: Li, Jinlin, et autres
Publié: (2025)
Boosting Zero-shot Stereo Matching using Large-scale Mixed Images Sources in the Real World
par: Wang, Yuran, et autres
Publié: (2025)
par: Wang, Yuran, et autres
Publié: (2025)
Video-Zero: Self-Evolution Video Understanding
par: Zhang, Ruixu, et autres
Publié: (2026)
par: Zhang, Ruixu, et autres
Publié: (2026)
TC-Light: Temporally Coherent Generative Rendering for Realistic World Transfer
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Mono2Stereo: Monocular Knowledge Transfer for Enhanced Stereo Matching
par: Wang, Yuran, et autres
Publié: (2024)
par: Wang, Yuran, et autres
Publié: (2024)
Masked Diffusion Vision-Language Models for Temporal Action Localization
par: Wang, Fengshun, et autres
Publié: (2026)
par: Wang, Fengshun, et autres
Publié: (2026)
Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
par: Li, Jiaqi, et autres
Publié: (2026)
par: Li, Jiaqi, et autres
Publié: (2026)
Localize, Understand, Collaborate: Semantic-Aware Dragging via Intention Reasoner
par: Cui, Xing, et autres
Publié: (2024)
par: Cui, Xing, et autres
Publié: (2024)
Temporal Action Detection Model Compression by Progressive Block Drop
par: Chen, Xiaoyong, et autres
Publié: (2025)
par: Chen, Xiaoyong, et autres
Publié: (2025)
Spatio-Temporal Progressive Attention Model for EEG Classification in Rapid Serial Visual Presentation Task
par: Li, Yang, et autres
Publié: (2025)
par: Li, Yang, et autres
Publié: (2025)
Progressive3D: Progressively Local Editing for Text-to-3D Content Creation with Complex Semantic Prompts
par: Cheng, Xinhua, et autres
Publié: (2023)
par: Cheng, Xinhua, et autres
Publié: (2023)
DA-HFNet: Progressive Fine-Grained Forgery Image Detection and Localization Based on Dual Attention
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
UHD-GPGNet: UHD Video Denoising via Gaussian-Process-Guided Local Spatio-Temporal Modeling
par: He, Weiyuan, et autres
Publié: (2026)
par: He, Weiyuan, et autres
Publié: (2026)
Progressive Cross-Stream Cooperation in Spatial and Temporal Domain for Action Localization
par: Su, Rui, et autres
Publié: (2019)
par: Su, Rui, et autres
Publié: (2019)
PMT: Progressive Mean Teacher via Exploring Temporal Consistency for Semi-Supervised Medical Image Segmentation
par: Gao, Ning, et autres
Publié: (2024)
par: Gao, Ning, et autres
Publié: (2024)
Temporal Action Localization with Cross Layer Task Decoupling and Refinement
par: Li, Qiang, et autres
Publié: (2024)
par: Li, Qiang, et autres
Publié: (2024)
Probing Deep into Temporal Profile Makes the Infrared Small Target Detector Much Better
par: Li, Ruojing, et autres
Publié: (2025)
par: Li, Ruojing, et autres
Publié: (2025)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
par: Wang, Liuyi, et autres
Publié: (2023)
par: Wang, Liuyi, et autres
Publié: (2023)
CaTFormer: Causal Temporal Transformer with Dynamic Contextual Fusion for Driving Intention Prediction
par: Wang, Sirui, et autres
Publié: (2025)
par: Wang, Sirui, et autres
Publié: (2025)
EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos
par: Ma, Junyi, et autres
Publié: (2025)
par: Ma, Junyi, et autres
Publié: (2025)
Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation
par: Wang, Wenxuan, et autres
Publié: (2023)
par: Wang, Wenxuan, et autres
Publié: (2023)
Word-Anchored Temporal Forgery Localization
par: Wang, Tianyi, et autres
Publié: (2026)
par: Wang, Tianyi, et autres
Publié: (2026)
Vision and Intention Boost Large Language Model in Long-Term Action Anticipation
par: Cao, Congqi, et autres
Publié: (2025)
par: Cao, Congqi, et autres
Publié: (2025)
Interactive Multimodal Fusion with Temporal Modeling
par: Yu, Jun, et autres
Publié: (2025)
par: Yu, Jun, et autres
Publié: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Documents similaires
-
Beyond the Individual: Introducing Group Intention Forecasting with SHOT Dataset
par: Zhang, Ruixu, et autres
Publié: (2025) -
Anomize: Better Open Vocabulary Video Anomaly Detection
par: Li, Fei, et autres
Publié: (2025) -
Towards Dense and Accurate Radar Perception Via Efficient Cross-Modal Diffusion Model
par: Zhang, Ruibin, et autres
Publié: (2024) -
Uncertainty-Aware Token Importance Estimation in Spiking Transformers
par: Liu, Wenxuan, et autres
Publié: (2026) -
Beyond Literal Descriptions: Understanding and Locating Open-World Objects Aligned with Human Intentions
par: Wang, Wenxuan, et autres
Publié: (2024)