Towards Hard and Soft Shadow Removal via Dual-Branch Separation Network and Vision Transformer
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Liang, Jiajia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
U-Net-Like Spiking Neural Networks for Single Image Dehazing
par: Li, Huibin, et autres
Publié: (2025)
par: Li, Huibin, et autres
Publié: (2025)
FoR-Net: Learning to Focus on Hard Regions for Efficient Semantic Segmentation
par: Chan, Sheng-Wei, et autres
Publié: (2026)
par: Chan, Sheng-Wei, et autres
Publié: (2026)
ViG-LRGC: Vision Graph Neural Networks with Learnable Reparameterized Graph Construction
par: Elsharkawi, Ismael, et autres
Publié: (2025)
par: Elsharkawi, Ismael, et autres
Publié: (2025)
MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction
par: Wang, Chao, et autres
Publié: (2025)
par: Wang, Chao, et autres
Publié: (2025)
BlindSight: Harnessing Sparsity for Efficient Vision-Language Models
par: Srikrishnan, Tharun Adithya, et autres
Publié: (2025)
par: Srikrishnan, Tharun Adithya, et autres
Publié: (2025)
YotoR-You Only Transform One Representation
par: Villa, José Ignacio Díaz, et autres
Publié: (2024)
par: Villa, José Ignacio Díaz, et autres
Publié: (2024)
Computer Vision for Clinical Gait Analysis: A Gait Abnormality Video Dataset
par: Ranjan, Rahm, et autres
Publié: (2024)
par: Ranjan, Rahm, et autres
Publié: (2024)
Watch Your Step: Information Injection in Diffusion Models via Shadow Timestep Embedding
par: Huang, An, et autres
Publié: (2026)
par: Huang, An, et autres
Publié: (2026)
SITransformer: Shared Information-Guided Transformer for Extreme Multimodal Summarization
par: Liu, Sicheng, et autres
Publié: (2024)
par: Liu, Sicheng, et autres
Publié: (2024)
A Comprehensive Review of YOLO Architectures in Computer Vision: From YOLOv1 to YOLOv8 and YOLO-NAS
par: Terven, Juan, et autres
Publié: (2023)
par: Terven, Juan, et autres
Publié: (2023)
GeoHeight-Bench: Towards Height-Aware Multimodal Reasoning in Remote Sensing
par: Hu, Xuran, et autres
Publié: (2026)
par: Hu, Xuran, et autres
Publié: (2026)
ERNet: Efficient Non-Rigid Registration Network for Point Sequences
par: He, Guangzhao, et autres
Publié: (2025)
par: He, Guangzhao, et autres
Publié: (2025)
Hierarchical Feature-level Reverse Propagation for Post-Training Neural Networks
par: Ding, Ni, et autres
Publié: (2025)
par: Ding, Ni, et autres
Publié: (2025)
DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding
par: Han, Yudong, et autres
Publié: (2024)
par: Han, Yudong, et autres
Publié: (2024)
NAC-TCN: Temporal Convolutional Networks with Causal Dilated Neighborhood Attention for Emotion Understanding
par: Mehta, Alexander, et autres
Publié: (2023)
par: Mehta, Alexander, et autres
Publié: (2023)
VisRL: Intention-Driven Visual Perception via Reinforced Reasoning
par: Chen, Zhangquan, et autres
Publié: (2025)
par: Chen, Zhangquan, et autres
Publié: (2025)
Illumination and Shadows in Head Rotation: experiments with Denoising Diffusion Models
par: Asperti, Andrea, et autres
Publié: (2023)
par: Asperti, Andrea, et autres
Publié: (2023)
PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
par: Satish, Siddarth Nilol Kundur, et autres
Publié: (2026)
par: Satish, Siddarth Nilol Kundur, et autres
Publié: (2026)
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025)
par: Raoufi, Behnam, et autres
Publié: (2025)
Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers
par: Zhao, Yiming
Publié: (2026)
par: Zhao, Yiming
Publié: (2026)
Video Event Reasoning and Prediction by Fusing World Knowledge from LLMs with Vision Foundation Models
par: Dubois, L'ea, et autres
Publié: (2025)
par: Dubois, L'ea, et autres
Publié: (2025)
More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
par: He, Wei
Publié: (2026)
par: He, Wei
Publié: (2026)
Context-Aware Network Based on Multi-scale Spatio-temporal Attention for Action Recognition in Videos
par: Li, Xiaoyang, et autres
Publié: (2025)
par: Li, Xiaoyang, et autres
Publié: (2025)
A Vision-Language Model for Focal Liver Lesion Classification
par: Jian, Song, et autres
Publié: (2025)
par: Jian, Song, et autres
Publié: (2025)
Combined Hyperbolic and Euclidean Soft Triple Loss Beyond the Single Space Deep Metric Learning
par: Saeki, Shozo, et autres
Publié: (2025)
par: Saeki, Shozo, et autres
Publié: (2025)
OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance
par: Wang, Chaoyi, et autres
Publié: (2025)
par: Wang, Chaoyi, et autres
Publié: (2025)
An Evaluation of a Visual Question Answering Strategy for Zero-shot Facial Expression Recognition in Still Images
par: Castrillón-Santana, Modesto, et autres
Publié: (2025)
par: Castrillón-Santana, Modesto, et autres
Publié: (2025)
Textual and Visual Guided Task Adaptation for Source-Free Cross-Domain Few-Shot Segmentation
par: Liu, Jianming, et autres
Publié: (2025)
par: Liu, Jianming, et autres
Publié: (2025)
Escaping The Big Data Paradigm in Self-Supervised Representation Learning
par: García, Carlos Vélez, et autres
Publié: (2025)
par: García, Carlos Vélez, et autres
Publié: (2025)
A self-supervised cyclic neural-analytic approach for novel view synthesis and 3D reconstruction
par: Costea, Dragos, et autres
Publié: (2025)
par: Costea, Dragos, et autres
Publié: (2025)
Co-Speech Gesture and Facial Expression Generation for Non-Photorealistic 3D Characters
par: Omine, Taisei, et autres
Publié: (2025)
par: Omine, Taisei, et autres
Publié: (2025)
UniQ: Unified Decoder with Task-specific Queries for Efficient Scene Graph Generation
par: Liao, Xinyao, et autres
Publié: (2025)
par: Liao, Xinyao, et autres
Publié: (2025)
Category-Agnostic Neural Object Rigging
par: He, Guangzhao, et autres
Publié: (2025)
par: He, Guangzhao, et autres
Publié: (2025)
VeS: Teaching Pixels to Listen Without Supervision
par: Raj, Sajay
Publié: (2025)
par: Raj, Sajay
Publié: (2025)
FocusedAD: Character-centric Movie Audio Description
par: Ye, Xiaojun, et autres
Publié: (2025)
par: Ye, Xiaojun, et autres
Publié: (2025)
A Recipe for Geometry-Aware 3D Mesh Transformers
par: Farazi, Mohammad, et autres
Publié: (2024)
par: Farazi, Mohammad, et autres
Publié: (2024)
A Challenging Benchmark of Anime Style Recognition
par: Li, Haotang, et autres
Publié: (2022)
par: Li, Haotang, et autres
Publié: (2022)
FUSE-Flow: Scalable Real-Time Multi-View Point Cloud Reconstruction Using Confidence
par: Sun, Chentian
Publié: (2026)
par: Sun, Chentian
Publié: (2026)
MSTA3D: Multi-scale Twin-attention for 3D Instance Segmentation
par: Tran, Duc Dang Trung, et autres
Publié: (2024)
par: Tran, Duc Dang Trung, et autres
Publié: (2024)
GMAC: Global Multi-View Constraint for Automatic Multi-Camera Extrinsic Calibration
par: Sun, Chentian
Publié: (2026)
par: Sun, Chentian
Publié: (2026)
Documents similaires
-
U-Net-Like Spiking Neural Networks for Single Image Dehazing
par: Li, Huibin, et autres
Publié: (2025) -
FoR-Net: Learning to Focus on Hard Regions for Efficient Semantic Segmentation
par: Chan, Sheng-Wei, et autres
Publié: (2026) -
ViG-LRGC: Vision Graph Neural Networks with Learnable Reparameterized Graph Construction
par: Elsharkawi, Ismael, et autres
Publié: (2025) -
MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction
par: Wang, Chao, et autres
Publié: (2025) -
BlindSight: Harnessing Sparsity for Efficient Vision-Language Models
par: Srikrishnan, Tharun Adithya, et autres
Publié: (2025)