Optimal Video Compression using Pixel Shift Tracking
Fuente:
arXiv
Guardado en:
| Autores principales: | Panneerselvam, Hitesh Saai Mananchery, Anand, Smit |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Exploring the Limits of Semantic Image Compression at Micro-bits per Pixel
por: Dotzel, Jordan, et al.
Publicado: (2024)
por: Dotzel, Jordan, et al.
Publicado: (2024)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
por: Kang, Minseok, et al.
Publicado: (2026)
por: Kang, Minseok, et al.
Publicado: (2026)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
por: Deng, Andong, et al.
Publicado: (2024)
por: Deng, Andong, et al.
Publicado: (2024)
Conditional Video Generation for High-Efficiency Video Compression
por: Yi, Fangqiu, et al.
Publicado: (2025)
por: Yi, Fangqiu, et al.
Publicado: (2025)
DeepFake Detection in Dyadic Video Calls using Point of Gaze Tracking
por: Kohler, Odin, et al.
Publicado: (2025)
por: Kohler, Odin, et al.
Publicado: (2025)
Temporal Object-Aware Vision Transformer for Few-Shot Video Object Detection
por: Kumar, Yogesh, et al.
Publicado: (2025)
por: Kumar, Yogesh, et al.
Publicado: (2025)
Accurate and Fast Compressed Video Captioning
por: Shen, Yaojie, et al.
Publicado: (2023)
por: Shen, Yaojie, et al.
Publicado: (2023)
Efficient Video Diffusion with Sparse Information Transmission for Video Compression
por: Zhou, Mingde, et al.
Publicado: (2026)
por: Zhou, Mingde, et al.
Publicado: (2026)
DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder
por: Chen, Junyu, et al.
Publicado: (2025)
por: Chen, Junyu, et al.
Publicado: (2025)
PixelGen: Improving Pixel Diffusion with Perceptual Supervision
por: Ma, Zehong, et al.
Publicado: (2026)
por: Ma, Zehong, et al.
Publicado: (2026)
CompTrack: Information Bottleneck-Guided Low-Rank Dynamic Token Compression for Point Cloud Tracking
por: Zhou, Sifan, et al.
Publicado: (2025)
por: Zhou, Sifan, et al.
Publicado: (2025)
Beyond Spatial Frequency: Pixel-wise Temporal Frequency-based Deepfake Video Detection
por: Kim, Taehoon, et al.
Publicado: (2025)
por: Kim, Taehoon, et al.
Publicado: (2025)
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs
por: Alansari, Mohamad, et al.
Publicado: (2026)
por: Alansari, Mohamad, et al.
Publicado: (2026)
PixelArena: A benchmark for Pixel-Precision Visual Intelligence
por: Liang, Feng, et al.
Publicado: (2025)
por: Liang, Feng, et al.
Publicado: (2025)
Pix2Gif: Motion-Guided Diffusion for GIF Generation
por: Kandala, Hitesh, et al.
Publicado: (2024)
por: Kandala, Hitesh, et al.
Publicado: (2024)
See Without Decoding: Motion-Vector-Based Tracking in Compressed Video
por: Duché, Axel, et al.
Publicado: (2026)
por: Duché, Axel, et al.
Publicado: (2026)
TinySAM 2: Extreme Memory Compression for Efficient Track Anything Model
por: Ding, Zhaoyuan, et al.
Publicado: (2026)
por: Ding, Zhaoyuan, et al.
Publicado: (2026)
Compressed-Domain-Aware Online Video Super-Resolution
por: Wang, Yuhang, et al.
Publicado: (2026)
por: Wang, Yuhang, et al.
Publicado: (2026)
Latent-Compressed Variational Autoencoder for Video Diffusion Models
por: Guan, Jiarui, et al.
Publicado: (2026)
por: Guan, Jiarui, et al.
Publicado: (2026)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
por: Liu, Ye, et al.
Publicado: (2025)
por: Liu, Ye, et al.
Publicado: (2025)
Not All Pixels Are Equal: Pixel-wise Meta-Learning for Medical Segmentation with Noisy Labels
por: Mu, Chenyu, et al.
Publicado: (2025)
por: Mu, Chenyu, et al.
Publicado: (2025)
When Better Eyes Lead to Blindness: A Diagnostic Study of the Information Bottleneck in CNN-LSTM Image Captioning Models
por: Gupta, Hitesh Kumar
Publicado: (2025)
por: Gupta, Hitesh Kumar
Publicado: (2025)
Motion Guided Token Compression for Efficient Masked Video Modeling
por: Feng, Yukun, et al.
Publicado: (2024)
por: Feng, Yukun, et al.
Publicado: (2024)
xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations
por: Qin, Can, et al.
Publicado: (2024)
por: Qin, Can, et al.
Publicado: (2024)
Low-Bitrate Video Compression through Semantic-Conditioned Diffusion
por: Wang, Lingdong, et al.
Publicado: (2025)
por: Wang, Lingdong, et al.
Publicado: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
por: Chen, Xueyi, et al.
Publicado: (2025)
por: Chen, Xueyi, et al.
Publicado: (2025)
Shifting AI Efficiency From Model-Centric to Data-Centric Compression
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
When Tracking Fails: Analyzing Failure Modes of SAM2 for Point-Based Tracking in Surgical Videos
por: Jang, Woowon, et al.
Publicado: (2025)
por: Jang, Woowon, et al.
Publicado: (2025)
VOVTrack: Exploring the Potentiality in Videos for Open-Vocabulary Object Tracking
por: Qian, Zekun, et al.
Publicado: (2024)
por: Qian, Zekun, et al.
Publicado: (2024)
STORM: End-to-End Referring Multi-Object Tracking in Videos
por: Lu, Zijia, et al.
Publicado: (2026)
por: Lu, Zijia, et al.
Publicado: (2026)
Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment
por: Tang, Jinzhou, et al.
Publicado: (2025)
por: Tang, Jinzhou, et al.
Publicado: (2025)
Impact of Video Compression Artifacts on Fisheye Camera Visual Perception Tasks
por: Sakthi, Madhumitha, et al.
Publicado: (2024)
por: Sakthi, Madhumitha, et al.
Publicado: (2024)
Task-Aware KV Compression For Cost-Effective Long Video Understanding
por: Qin, Minghao, et al.
Publicado: (2025)
por: Qin, Minghao, et al.
Publicado: (2025)
A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos
por: He, Allen, et al.
Publicado: (2026)
por: He, Allen, et al.
Publicado: (2026)
Heterogeneous Graph Transformer for Multiple Tiny Object Tracking in RGB-T Videos
por: Xu, Qingyu, et al.
Publicado: (2024)
por: Xu, Qingyu, et al.
Publicado: (2024)
TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models
por: Li, Pengxiang, et al.
Publicado: (2023)
por: Li, Pengxiang, et al.
Publicado: (2023)
PolypSegTrack: Unified Foundation Model for Colonoscopy Video Analysis
por: Choudhuri, Anwesa, et al.
Publicado: (2025)
por: Choudhuri, Anwesa, et al.
Publicado: (2025)
Deep Pulse-Signal Magnification for remote Heart Rate Estimation in Compressed Videos
por: Comas, Joaquim, et al.
Publicado: (2024)
por: Comas, Joaquim, et al.
Publicado: (2024)
Model Compression using Progressive Channel Pruning
por: Guo, Jinyang, et al.
Publicado: (2025)
por: Guo, Jinyang, et al.
Publicado: (2025)
Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization
por: Wang, Cong, et al.
Publicado: (2025)
por: Wang, Cong, et al.
Publicado: (2025)
Ejemplares similares
-
Exploring the Limits of Semantic Image Compression at Micro-bits per Pixel
por: Dotzel, Jordan, et al.
Publicado: (2024) -
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
por: Kang, Minseok, et al.
Publicado: (2026) -
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
por: Deng, Andong, et al.
Publicado: (2024) -
Conditional Video Generation for High-Efficiency Video Compression
por: Yi, Fangqiu, et al.
Publicado: (2025) -
DeepFake Detection in Dyadic Video Calls using Point of Gaze Tracking
por: Kohler, Odin, et al.
Publicado: (2025)