A Perspective on Deep Vision Performance with Standard Image and Video Codecs
Fuente:
arXiv
Guardado en:
| Autores principales: | Reich, Christoph, Hahn, Oliver, Cremers, Daniel, Roth, Stefan, Debnath, Biplob |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Deep Video Codec Control for Vision Models
por: Reich, Christoph, et al.
Publicado: (2023)
por: Reich, Christoph, et al.
Publicado: (2023)
Differentiable JPEG: The Devil is in the Details
por: Reich, Christoph, et al.
Publicado: (2023)
por: Reich, Christoph, et al.
Publicado: (2023)
Compression of 3D Gaussian Splatting with Optimized Feature Planes and Standard Video Codecs
por: Lee, Soonbin, et al.
Publicado: (2025)
por: Lee, Soonbin, et al.
Publicado: (2025)
Reversing the Damage: A QP-Aware Transformer-Diffusion Approach for 8K Video Restoration under Codec Compression
por: Dehaghi, Ali Mollaahmadi, et al.
Publicado: (2024)
por: Dehaghi, Ali Mollaahmadi, et al.
Publicado: (2024)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
por: Nishimura, Taichi, et al.
Publicado: (2023)
por: Nishimura, Taichi, et al.
Publicado: (2023)
Scene-Centric Unsupervised Panoptic Segmentation
por: Hahn, Oliver, et al.
Publicado: (2025)
por: Hahn, Oliver, et al.
Publicado: (2025)
Diversify, Contextualize, and Adapt: Efficient Entropy Modeling for Neural Image Codec
por: Kim, Jun-Hyuk, et al.
Publicado: (2024)
por: Kim, Jun-Hyuk, et al.
Publicado: (2024)
A Preprocessing Framework for Video Machine Vision under Compression
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
Benchmarking Conventional and Learned Video Codecs with a Low-Delay Configuration
por: Teng, Siyue, et al.
Publicado: (2024)
por: Teng, Siyue, et al.
Publicado: (2024)
Unveiling Deep Shadows: A Survey and Benchmark on Image and Video Shadow Detection, Removal, and Generation in the Deep Learning Era
por: Hu, Xiaowei, et al.
Publicado: (2024)
por: Hu, Xiaowei, et al.
Publicado: (2024)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
por: Zhang, Zhongwei, et al.
Publicado: (2025)
por: Zhang, Zhongwei, et al.
Publicado: (2025)
Mitigating Image Captioning Hallucinations in Vision-Language Models
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
CustomContrast: A Multilevel Contrastive Perspective For Subject-Driven Text-to-Image Customization
por: Chen, Nan, et al.
Publicado: (2024)
por: Chen, Nan, et al.
Publicado: (2024)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
por: Zhang, Zhongwei, et al.
Publicado: (2024)
por: Zhang, Zhongwei, et al.
Publicado: (2024)
Fine-grained Image Retrieval via Dual-Vision Adaptation
por: Jiang, Xin, et al.
Publicado: (2025)
por: Jiang, Xin, et al.
Publicado: (2025)
Generalized Video Anomaly Event Detection: Systematic Taxonomy and Comparison of Deep Models
por: Liu, Yang, et al.
Publicado: (2023)
por: Liu, Yang, et al.
Publicado: (2023)
Scaling and Masking: A New Paradigm of Data Sampling for Image and Video Quality Assessment
por: Liu, Yongxu, et al.
Publicado: (2024)
por: Liu, Yongxu, et al.
Publicado: (2024)
Feed-Forward SceneDINO for Unsupervised Semantic Scene Completion
por: Jevtić, Aleksandar, et al.
Publicado: (2025)
por: Jevtić, Aleksandar, et al.
Publicado: (2025)
VIoTGPT: Learning to Schedule Vision Tools in LLMs towards Intelligent Video Internet of Things
por: Zhong, Yaoyao, et al.
Publicado: (2023)
por: Zhong, Yaoyao, et al.
Publicado: (2023)
DeepSPG: Exploring Deep Semantic Prior Guidance for Low-light Image Enhancement with Multimodal Learning
por: Lu, Jialang, et al.
Publicado: (2025)
por: Lu, Jialang, et al.
Publicado: (2025)
Calibration & Reconstruction: Deep Integrated Language for Referring Image Segmentation
por: Yan, Yichen, et al.
Publicado: (2024)
por: Yan, Yichen, et al.
Publicado: (2024)
Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text Matching
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
por: Zhu, Xilei, et al.
Publicado: (2024)
por: Zhu, Xilei, et al.
Publicado: (2024)
VAAS: Vision-Attention Anomaly Scoring for Image Manipulation Detection in Digital Forensics
por: Bamigbade, Opeyemi, et al.
Publicado: (2025)
por: Bamigbade, Opeyemi, et al.
Publicado: (2025)
Deep Shape-Texture Statistics for Completely Blind Image Quality Evaluation
por: Li, Yixuan, et al.
Publicado: (2024)
por: Li, Yixuan, et al.
Publicado: (2024)
MVPbev: Multi-view Perspective Image Generation from BEV with Test-time Controllability and Generalizability
por: Liu, Buyu, et al.
Publicado: (2024)
por: Liu, Buyu, et al.
Publicado: (2024)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
por: Qiao, Xiangshuo, et al.
Publicado: (2024)
por: Qiao, Xiangshuo, et al.
Publicado: (2024)
P-GSVC: Layered Progressive 2D Gaussian Splatting for Scalable Image and Video
por: Wang, Longan, et al.
Publicado: (2026)
por: Wang, Longan, et al.
Publicado: (2026)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
por: Wang, Xiang, et al.
Publicado: (2025)
por: Wang, Xiang, et al.
Publicado: (2025)
Clean Image May be Dangerous: Data Poisoning Attacks Against Deep Hashing
por: Li, Shuai, et al.
Publicado: (2025)
por: Li, Shuai, et al.
Publicado: (2025)
When and How to Cut Classical Concerts? A Multimodal Automated Video Editing Approach
por: Gonzálbez-Biosca, Daniel, et al.
Publicado: (2025)
por: Gonzálbez-Biosca, Daniel, et al.
Publicado: (2025)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
por: Gao, Jiayi, et al.
Publicado: (2025)
por: Gao, Jiayi, et al.
Publicado: (2025)
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
por: Xu, Jiaqi, et al.
Publicado: (2024)
por: Xu, Jiaqi, et al.
Publicado: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
por: Zhu, Hongyi, et al.
Publicado: (2024)
por: Zhu, Hongyi, et al.
Publicado: (2024)
PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
por: Xu, Jingning, et al.
Publicado: (2026)
por: Xu, Jingning, et al.
Publicado: (2026)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
por: Yang, Haibo, et al.
Publicado: (2024)
por: Yang, Haibo, et al.
Publicado: (2024)
Motion-Refined DINOSAUR for Unsupervised Multi-Object Discovery
por: Gong, Xinrui, et al.
Publicado: (2025)
por: Gong, Xinrui, et al.
Publicado: (2025)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
por: Fang, Xinyu, et al.
Publicado: (2024)
por: Fang, Xinyu, et al.
Publicado: (2024)
The Practice of Averaging Rate-Distortion Curves over Testsets to Compare Learned Video Codecs Can Cause Misleading Conclusions
por: Yilmaz, M. Akin, et al.
Publicado: (2024)
por: Yilmaz, M. Akin, et al.
Publicado: (2024)
A Human-Annotated Video Dataset for Training and Evaluation of 360-Degree Video Summarization Methods
por: Kontostathis, Ioannis, et al.
Publicado: (2024)
por: Kontostathis, Ioannis, et al.
Publicado: (2024)
Ejemplares similares
-
Deep Video Codec Control for Vision Models
por: Reich, Christoph, et al.
Publicado: (2023) -
Differentiable JPEG: The Devil is in the Details
por: Reich, Christoph, et al.
Publicado: (2023) -
Compression of 3D Gaussian Splatting with Optimized Feature Planes and Standard Video Codecs
por: Lee, Soonbin, et al.
Publicado: (2025) -
Reversing the Damage: A QP-Aware Transformer-Diffusion Approach for 8K Video Restoration under Codec Compression
por: Dehaghi, Ali Mollaahmadi, et al.
Publicado: (2024) -
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
por: Nishimura, Taichi, et al.
Publicado: (2023)