Compressed-Language Models for Understanding Compressed File Formats: a JPEG Exploration
Fuente:
arXiv
Saved in:
| Main Authors: | Pérez, Juan C., Pardo, Alejandro, Soldan, Mattia, Itani, Hani, Leon-Alcazar, Juan, Ghanem, Bernard |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
by: Zohra, Fatimah, et al.
Published: (2025)
by: Zohra, Fatimah, et al.
Published: (2025)
Transformers from Compressed Representations
by: Alcazar, Juan C. Leon, et al.
Published: (2025)
by: Alcazar, Juan C. Leon, et al.
Published: (2025)
X-VARS: Introducing Explainability in Football Refereeing with Multi-Modal Large Language Model
by: Held, Jan, et al.
Published: (2024)
by: Held, Jan, et al.
Published: (2024)
Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models
by: Villa, Andrés, et al.
Published: (2023)
by: Villa, Andrés, et al.
Published: (2023)
Raw-JPEG Adapter: Efficient Raw Image Compression with JPEG
by: Afifi, Mahmoud, et al.
Published: (2025)
by: Afifi, Mahmoud, et al.
Published: (2025)
Evaluation of Test-Time Adaptation Under Computational Time Constraints
by: Alfarra, Motasem, et al.
Published: (2023)
by: Alfarra, Motasem, et al.
Published: (2023)
OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection
by: Liu, Shuming, et al.
Published: (2025)
by: Liu, Shuming, et al.
Published: (2025)
Towards Automated Movie Trailer Generation
by: Argaw, Dawit Mureja, et al.
Published: (2024)
by: Argaw, Dawit Mureja, et al.
Published: (2024)
MoCA-Video: Motion-Aware Concept Alignment for Consistent Video Editing
by: Zhang, Tong, et al.
Published: (2025)
by: Zhang, Tong, et al.
Published: (2025)
Compression-Aware One-Step Diffusion Model for JPEG Artifact Removal
by: Guo, Jinpei, et al.
Published: (2025)
by: Guo, Jinpei, et al.
Published: (2025)
SODiff: Semantic-Oriented Diffusion Model for JPEG Compression Artifacts Removal
by: Yang, Tingyu, et al.
Published: (2025)
by: Yang, Tingyu, et al.
Published: (2025)
EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models
by: Villa, Andrés, et al.
Published: (2025)
by: Villa, Andrés, et al.
Published: (2025)
Exploring Missing Modality in Multimodal Egocentric Datasets
by: Ramazanova, Merey, et al.
Published: (2024)
by: Ramazanova, Merey, et al.
Published: (2024)
Test-Time Adaptation for Combating Missing Modalities in Egocentric Videos
by: Ramazanova, Merey, et al.
Published: (2024)
by: Ramazanova, Merey, et al.
Published: (2024)
Learning Single-Image Super-Resolution in the JPEG Compressed Domain
by: Srinivasan, Sruthi, et al.
Published: (2025)
by: Srinivasan, Sruthi, et al.
Published: (2025)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
by: Liu, Shuming, et al.
Published: (2025)
by: Liu, Shuming, et al.
Published: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
by: Wang, Ziyao, et al.
Published: (2026)
by: Wang, Ziyao, et al.
Published: (2026)
SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
by: Hammoud, Hasan Abed Al Kader, et al.
Published: (2024)
by: Hammoud, Hasan Abed Al Kader, et al.
Published: (2024)
Forget Less, Retain More: A Lightweight Regularizer for Rehearsal-Based Continual Learning
by: Alssum, Lama, et al.
Published: (2025)
by: Alssum, Lama, et al.
Published: (2025)
JPEG AI Image Compression Visual Artifacts: Detection Methods and Dataset
by: Tsereh, Daria, et al.
Published: (2024)
by: Tsereh, Daria, et al.
Published: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
by: Lan, Xiaohan, et al.
Published: (2024)
by: Lan, Xiaohan, et al.
Published: (2024)
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
by: Barrios, Wayner, et al.
Published: (2025)
by: Barrios, Wayner, et al.
Published: (2025)
ResidualViT for Efficient Temporally Dense Video Encoding
by: Soldan, Mattia, et al.
Published: (2025)
by: Soldan, Mattia, et al.
Published: (2025)
ADVMEM: Adversarial Memory Initialization for Realistic Test-Time Adaptation via Tracklet-Based Benchmarking
by: Alhuwaider, Shyma, et al.
Published: (2025)
by: Alhuwaider, Shyma, et al.
Published: (2025)
Pix4Point: Image Pretrained Standard Transformers for 3D Point Cloud Understanding
by: Qian, Guocheng, et al.
Published: (2022)
by: Qian, Guocheng, et al.
Published: (2022)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
by: Shen, Xiaoqian, et al.
Published: (2024)
by: Shen, Xiaoqian, et al.
Published: (2024)
MatchDiffusion: Training-free Generation of Match-cuts
by: Pardo, Alejandro, et al.
Published: (2024)
by: Pardo, Alejandro, et al.
Published: (2024)
Neural Network Assisted Lifting Steps For Improved Fully Scalable Lossy Image Compression in JPEG 2000
by: Li, Xinyue, et al.
Published: (2024)
by: Li, Xinyue, et al.
Published: (2024)
Benchmarking and Enhancing VLM for Compressed Image Understanding
by: Zhang, Zifu, et al.
Published: (2025)
by: Zhang, Zifu, et al.
Published: (2025)
Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression
by: Tanvir, Md Tasnin, et al.
Published: (2025)
by: Tanvir, Md Tasnin, et al.
Published: (2025)
Recompression Based JPEG Tamper Detection and Localization Using Deep Neural Network Eliminating Compression Factor Dependency
by: Bakas, Jamimamul, et al.
Published: (2024)
by: Bakas, Jamimamul, et al.
Published: (2024)
JPEG Compliant Compression for Both Human and Machine, A Report
by: Ye, Linfeng
Published: (2025)
by: Ye, Linfeng
Published: (2025)
JPEG Inspired Deep Learning
by: Salamah, Ahmed H., et al.
Published: (2024)
by: Salamah, Ahmed H., et al.
Published: (2024)
Seeing Delta Parameters as JPEG Images: Data-Free Delta Compression with Discrete Cosine Transform
by: Huang, Chenyu, et al.
Published: (2025)
by: Huang, Chenyu, et al.
Published: (2025)
OFA-Diffusion Compression: Compressing Diffusion Model in One-Shot Manner
by: Jiang, Haoyang, et al.
Published: (2026)
by: Jiang, Haoyang, et al.
Published: (2026)
CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation
by: Messina, Pablo, et al.
Published: (2026)
by: Messina, Pablo, et al.
Published: (2026)
AgentCompress: Task-Aware Compression for Affordable Large Language Model Agents
by: Taha, Zuhair Ahmed Khan, et al.
Published: (2026)
by: Taha, Zuhair Ahmed Khan, et al.
Published: (2026)
Video Self-Stitching Graph Network for Temporal Action Localization
by: Zhao, Chen, et al.
Published: (2020)
by: Zhao, Chen, et al.
Published: (2020)
CompressNAS : A Fast and Efficient Technique for Model Compression using Decomposition
by: Sah, Sudhakar, et al.
Published: (2025)
by: Sah, Sudhakar, et al.
Published: (2025)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
by: Cao, Sihan, et al.
Published: (2026)
by: Cao, Sihan, et al.
Published: (2026)
Similar Items
-
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
by: Zohra, Fatimah, et al.
Published: (2025) -
Transformers from Compressed Representations
by: Alcazar, Juan C. Leon, et al.
Published: (2025) -
X-VARS: Introducing Explainability in Football Refereeing with Multi-Modal Large Language Model
by: Held, Jan, et al.
Published: (2024) -
Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models
by: Villa, Andrés, et al.
Published: (2023) -
Raw-JPEG Adapter: Efficient Raw Image Compression with JPEG
by: Afifi, Mahmoud, et al.
Published: (2025)