Does Semantic Noise Initialization Transfer from Images to Videos? A Paired Diagnostic Study
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jing, Yixiao, Zhang, Chaoyu, Zhong, Zixuan, Huang, Peizhou |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
IELDG: Suppressing Domain-Specific Noise with Inverse Evolution Layers for Domain Generalized Semantic Segmentation
par: Fan, Qizhe, et autres
Publié: (2025)
par: Fan, Qizhe, et autres
Publié: (2025)
FastInit: Fast Noise Initialization for Temporally Consistent Video Generation
par: Bai, Chengyu, et autres
Publié: (2025)
par: Bai, Chengyu, et autres
Publié: (2025)
Tuning-free Instruction-based Video Editing Via Structural Noise Initialization and Guidance
par: Wu, Song, et autres
Publié: (2026)
par: Wu, Song, et autres
Publié: (2026)
GuidNoise: Single-Pair Guided Diffusion for Generalized Noise Synthesis
par: Kim, Changjin, et autres
Publié: (2025)
par: Kim, Changjin, et autres
Publié: (2025)
Cross-Modal Transferable Image-to-Video Attack on Video Quality Metrics
par: Gotin, Georgii, et autres
Publié: (2025)
par: Gotin, Georgii, et autres
Publié: (2025)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
par: Li, Jialu, et autres
Publié: (2025)
par: Li, Jialu, et autres
Publié: (2025)
Video Flow as Time Series: Discovering Temporal Consistency and Variability for VideoQA
par: Song, Zijie, et autres
Publié: (2025)
par: Song, Zijie, et autres
Publié: (2025)
SGP-SAM: Self-Gated Prompting for Transferring 3D Segment Anything Models to Lesion Segmentation
par: Tang, Zixuan, et autres
Publié: (2026)
par: Tang, Zixuan, et autres
Publié: (2026)
Top-Down Semantic Refinement for Image Captioning
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
How Much 3D Do Video Foundation Models Encode?
par: Huang, Zixuan, et autres
Publié: (2025)
par: Huang, Zixuan, et autres
Publié: (2025)
LPNSR: Optimal Noise-Guided Diffusion Image Super-Resolution Via Learnable Noise Prediction
par: Huang, Shuwei, et autres
Publié: (2026)
par: Huang, Shuwei, et autres
Publié: (2026)
VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer
par: Lin, Rui, et autres
Publié: (2026)
par: Lin, Rui, et autres
Publié: (2026)
PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting
par: Song, Yixiao, et autres
Publié: (2026)
par: Song, Yixiao, et autres
Publié: (2026)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
par: Lin, Jingli, et autres
Publié: (2025)
par: Lin, Jingli, et autres
Publié: (2025)
Zero-to-Hero: Zero-Shot Initialization Empowering Reference-Based Video Appearance Editing
par: Su, Tongtong, et autres
Publié: (2025)
par: Su, Tongtong, et autres
Publié: (2025)
SAT3D: Image-driven Semantic Attribute Transfer in 3D
par: Zhai, Zhijun, et autres
Publié: (2024)
par: Zhai, Zhijun, et autres
Publié: (2024)
Spatial-Aware Latent Initialization for Controllable Image Generation
par: Sun, Wenqiang, et autres
Publié: (2024)
par: Sun, Wenqiang, et autres
Publié: (2024)
Boosting Generalizability towards Zero-Shot Cross-Dataset Single-Image Indoor Depth by Meta-Initialization
par: Wu, Cho-Ying, et autres
Publié: (2024)
par: Wu, Cho-Ying, et autres
Publié: (2024)
A Second-Order Perspective on Pruning at Initialization and Knowledge Transfer
par: Iurada, Leonardo, et autres
Publié: (2025)
par: Iurada, Leonardo, et autres
Publié: (2025)
Combating Semantic Contamination in Learning with Label Noise
par: Fan, Wenxiao, et autres
Publié: (2024)
par: Fan, Wenxiao, et autres
Publié: (2024)
Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey
par: Li, Jinxuan, et autres
Publié: (2025)
par: Li, Jinxuan, et autres
Publié: (2025)
InpaintSLat: Inpainting Structured 3D Latents via Initial Noise Optimization
par: Chung, Jaeyoung, et autres
Publié: (2026)
par: Chung, Jaeyoung, et autres
Publié: (2026)
Paired Image Generation with Diffusion-Guided Diffusion Models
par: Zhang, Haoxuan, et autres
Publié: (2025)
par: Zhang, Haoxuan, et autres
Publié: (2025)
Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge
par: Xu, Yinsong, et autres
Publié: (2026)
par: Xu, Yinsong, et autres
Publié: (2026)
Videoshop: Localized Semantic Video Editing with Noise-Extrapolated Diffusion Inversion
par: Fan, Xiang, et autres
Publié: (2024)
par: Fan, Xiang, et autres
Publié: (2024)
StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling
par: Jing, Liqi, et autres
Publié: (2026)
par: Jing, Liqi, et autres
Publié: (2026)
ArchShapeNet:An Interpretable 3D-CNN Framework for Evaluating Architectural Shapes
par: Yin, Jun, et autres
Publié: (2025)
par: Yin, Jun, et autres
Publié: (2025)
Plan-X: Instruct Video Generation via Semantic Planning
par: Huang, Lun, et autres
Publié: (2025)
par: Huang, Lun, et autres
Publié: (2025)
A Survey on Backbones for Deep Video Action Recognition
par: Tang, Zixuan, et autres
Publié: (2024)
par: Tang, Zixuan, et autres
Publié: (2024)
One Patient's Annotation is Another One's Initialization: Towards Zero-Shot Surgical Video Segmentation with Cross-Patient Initialization
par: Mousavi, Seyed Amir, et autres
Publié: (2025)
par: Mousavi, Seyed Amir, et autres
Publié: (2025)
NoiseDiffusion: Correcting Noise for Image Interpolation with Diffusion Models beyond Spherical Linear Interpolation
par: Zheng, PengFei, et autres
Publié: (2024)
par: Zheng, PengFei, et autres
Publié: (2024)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
par: Gao, Mingze, et autres
Publié: (2024)
par: Gao, Mingze, et autres
Publié: (2024)
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
par: Yang, Junqi, et autres
Publié: (2026)
par: Yang, Junqi, et autres
Publié: (2026)
MetaSSC: Enhancing 3D Semantic Scene Completion for Autonomous Driving through Meta-Learning and Long-sequence Modeling
par: Qu, Yansong, et autres
Publié: (2024)
par: Qu, Yansong, et autres
Publié: (2024)
NeuroBridge: Bio-Inspired Self-Supervised EEG-to-Image Decoding via Cognitive Priors and Bidirectional Semantic Alignment
par: Zhang, Wenjiang, et autres
Publié: (2025)
par: Zhang, Wenjiang, et autres
Publié: (2025)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
par: Du, Jie, et autres
Publié: (2025)
par: Du, Jie, et autres
Publié: (2025)
Enhance Vision-Language Alignment with Noise
par: Huang, Sida, et autres
Publié: (2024)
par: Huang, Sida, et autres
Publié: (2024)
TMT: Cross-domain Semantic Segmentation with Region-adaptive Transferability Estimation
par: Zhang, Enming, et autres
Publié: (2025)
par: Zhang, Enming, et autres
Publié: (2025)
Video-As-Prompt: Unified Semantic Control for Video Generation
par: Bian, Yuxuan, et autres
Publié: (2025)
par: Bian, Yuxuan, et autres
Publié: (2025)
Beyond the Individual: Introducing Group Intention Forecasting with SHOT Dataset
par: Zhang, Ruixu, et autres
Publié: (2025)
par: Zhang, Ruixu, et autres
Publié: (2025)
Documents similaires
-
IELDG: Suppressing Domain-Specific Noise with Inverse Evolution Layers for Domain Generalized Semantic Segmentation
par: Fan, Qizhe, et autres
Publié: (2025) -
FastInit: Fast Noise Initialization for Temporally Consistent Video Generation
par: Bai, Chengyu, et autres
Publié: (2025) -
Tuning-free Instruction-based Video Editing Via Structural Noise Initialization and Guidance
par: Wu, Song, et autres
Publié: (2026) -
GuidNoise: Single-Pair Guided Diffusion for Generalized Noise Synthesis
par: Kim, Changjin, et autres
Publié: (2025) -
Cross-Modal Transferable Image-to-Video Attack on Video Quality Metrics
par: Gotin, Georgii, et autres
Publié: (2025)