DTTNet: Improving Video Shadow Detection via Dark-Aware Guidance and Tokenized Temporal Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Zhicheng, Sun, Kunyang, Yao, Rui, Zhu, Hancheng, Hu, Fuyuan, Zhao, Jiaqi, Shao, Zhiwen, Zhou, Yong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Modality-Guided Dynamic Graph Fusion and Temporal Diffusion for Self-Supervised RGB-T Tracking
by: Li, Shenglan, et al.
Published: (2025)
by: Li, Shenglan, et al.
Published: (2025)
Facial Action Unit Detection by Adaptively Constraining Self-Attention and Causally Deconfounding Sample
by: Shao, Zhiwen, et al.
Published: (2024)
by: Shao, Zhiwen, et al.
Published: (2024)
RQFormer: Rotated Query Transformer for End-to-End Oriented Object Detection
by: Zhao, Jiaqi, et al.
Published: (2023)
by: Zhao, Jiaqi, et al.
Published: (2023)
Content-Adaptive Image Retouching Guided by Attribute-Based Text Representation
by: Zhu, Hancheng, et al.
Published: (2025)
by: Zhu, Hancheng, et al.
Published: (2025)
DiffusionLane: Diffusion Model for Lane Detection
by: Zhou, Kunyang, et al.
Published: (2025)
by: Zhou, Kunyang, et al.
Published: (2025)
Lane2Seq: Towards Unified Lane Detection via Sequence Generation
by: Zhou, Kunyang
Published: (2024)
by: Zhou, Kunyang
Published: (2024)
Exploring the Delocalization of Dark States in a Multimode Optical Cavity
by: Sun, Kunyang, et al.
Published: (2025)
by: Sun, Kunyang, et al.
Published: (2025)
OrientedFormer: An End-to-End Transformer-Based Oriented Object Detector in Remote Sensing Images
by: Zhao, Jiaqi, et al.
Published: (2024)
by: Zhao, Jiaqi, et al.
Published: (2024)
Hybrid Audio Detection Using Fine-Tuned Audio Spectrogram Transformers: A Dataset-Driven Evaluation of Mixed AI-Human Speech
by: Huang, Kunyang, et al.
Published: (2025)
by: Huang, Kunyang, et al.
Published: (2025)
DTT-BSR: GAN-based DTTNet with RoPE Transformer Enhancement for Music Source Restoration
by: Tan, Shihong, et al.
Published: (2026)
by: Tan, Shihong, et al.
Published: (2026)
MatteViT: High-Frequency-Aware Document Shadow Removal with Shadow Matte Guidance
by: Kim, Chaewon, et al.
Published: (2025)
by: Kim, Chaewon, et al.
Published: (2025)
3DTTNet: Multimodal Fusion-Based 3D Traversable Terrain Modeling for Off-Road Environments
by: Chen, Zitong, et al.
Published: (2024)
by: Chen, Zitong, et al.
Published: (2024)
Object-Aware Video Matting with Cross-Frame Guidance
by: Zhang, Huayu, et al.
Published: (2025)
by: Zhang, Huayu, et al.
Published: (2025)
Learning Where to Focus: Density-Driven Guidance for Detecting Dense Tiny Objects
by: Zhao, Zhicheng, et al.
Published: (2025)
by: Zhao, Zhicheng, et al.
Published: (2025)
SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization
by: Tan, Zhentao, et al.
Published: (2024)
by: Tan, Zhentao, et al.
Published: (2024)
Training-Trajectory-Aware Token Selection
by: Shen, Zhanming, et al.
Published: (2026)
by: Shen, Zhanming, et al.
Published: (2026)
Improving Token-based Object Detection with Video
by: Singh, Abhineet, et al.
Published: (2025)
by: Singh, Abhineet, et al.
Published: (2025)
Timeline and Boundary Guided Diffusion Network for Video Shadow Detection
by: Zhou, Haipeng, et al.
Published: (2024)
by: Zhou, Haipeng, et al.
Published: (2024)
Delving into Dark Regions for Robust Shadow Detection
by: Guan, Huankang, et al.
Published: (2024)
by: Guan, Huankang, et al.
Published: (2024)
AdaShadow: Responsive Test-time Model Adaptation in Non-stationary Mobile Environments
by: Fang, Cheng, et al.
Published: (2024)
by: Fang, Cheng, et al.
Published: (2024)
Unsupervised Domain Adaptive Lane Detection via Contextual Contrast and Aggregation
by: Zhou, Kunyang, et al.
Published: (2024)
by: Zhou, Kunyang, et al.
Published: (2024)
CALA: A Class-Aware Logit Adapter for Few-Shot Class-Incremental Learning
by: Liu, Chengyan, et al.
Published: (2024)
by: Liu, Chengyan, et al.
Published: (2024)
Video Instance Shadow Detection Under the Sun and Sky
by: Xing, Zhenghao, et al.
Published: (2022)
by: Xing, Zhenghao, et al.
Published: (2022)
Robust Lane Detection with Wavelet-Enhanced Context Modeling and Adaptive Sampling
by: Li, Kunyang, et al.
Published: (2025)
by: Li, Kunyang, et al.
Published: (2025)
Transformers Learn the Optimal DDPM Denoiser for Multi-Token GMMs
by: Li, Hongkang, et al.
Published: (2026)
by: Li, Hongkang, et al.
Published: (2026)
Dynamic-Aware Video Distillation: Optimizing Temporal Resolution Based on Video Semantics
by: Zhao, Yinjie, et al.
Published: (2025)
by: Zhao, Yinjie, et al.
Published: (2025)
Multi-Floor Exploration for Ground Robots via an Incremental Reachable Graph and Structural Priors
by: Zhu, Zhiwen, et al.
Published: (2026)
by: Zhu, Zhiwen, et al.
Published: (2026)
Temporal Inconsistency Guidance for Super-resolution Video Quality Assessment
by: Li, Yixiao, et al.
Published: (2024)
by: Li, Yixiao, et al.
Published: (2024)
MetaNeRV: Meta Neural Representations for Videos with Spatial-Temporal Guidance
by: Guo, Jialong, et al.
Published: (2025)
by: Guo, Jialong, et al.
Published: (2025)
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
by: Zhang, Jianrui, et al.
Published: (2026)
by: Zhang, Jianrui, et al.
Published: (2026)
Full-Angle Ray Antenna Array and Omnicell Wireless Communication System
by: Zhu, Xuancheng, et al.
Published: (2025)
by: Zhu, Xuancheng, et al.
Published: (2025)
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs
by: Park, Minyoung, et al.
Published: (2026)
by: Park, Minyoung, et al.
Published: (2026)
Lignin Nanoparticles‐A Sustainable Bridge From Biomass Waste to Advanced Materials
by: Fuyuan Lu, et al.
Published: (2026)
by: Fuyuan Lu, et al.
Published: (2026)
Enhancing Diffusion Policy with Classifier-Free Guidance for Temporal Robotic Tasks
by: Lu, Yuang, et al.
Published: (2025)
by: Lu, Yuang, et al.
Published: (2025)
Unveiling Deep Shadows: A Survey and Benchmark on Image and Video Shadow Detection, Removal, and Generation in the Deep Learning Era
by: Hu, Xiaowei, et al.
Published: (2024)
by: Hu, Xiaowei, et al.
Published: (2024)
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
by: Shen, Leqi, et al.
Published: (2024)
by: Shen, Leqi, et al.
Published: (2024)
Language-Driven Interactive Shadow Detection
by: Wang, Hongqiu, et al.
Published: (2024)
by: Wang, Hongqiu, et al.
Published: (2024)
Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion
by: Li, Kunyang, et al.
Published: (2026)
by: Li, Kunyang, et al.
Published: (2026)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
by: Fan, Rong, et al.
Published: (2026)
by: Fan, Rong, et al.
Published: (2026)
Category-Aware Dynamic Label Assignment with High-Quality Oriented Proposal
by: Feng, Mingkui, et al.
Published: (2024)
by: Feng, Mingkui, et al.
Published: (2024)
Similar Items
-
Modality-Guided Dynamic Graph Fusion and Temporal Diffusion for Self-Supervised RGB-T Tracking
by: Li, Shenglan, et al.
Published: (2025) -
Facial Action Unit Detection by Adaptively Constraining Self-Attention and Causally Deconfounding Sample
by: Shao, Zhiwen, et al.
Published: (2024) -
RQFormer: Rotated Query Transformer for End-to-End Oriented Object Detection
by: Zhao, Jiaqi, et al.
Published: (2023) -
Content-Adaptive Image Retouching Guided by Attribute-Based Text Representation
by: Zhu, Hancheng, et al.
Published: (2025) -
DiffusionLane: Diffusion Model for Lane Detection
by: Zhou, Kunyang, et al.
Published: (2025)