Tell Codec What Worth Compressing: Semantically Disentangled Image Coding for Machine with LMMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Jinming, Wei, Yuntao, Lin, Junyan, Zhao, Shengyang, Sun, Heming, Chen, Zhibo, Zeng, Wenjun, Jin, Xin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion
por: Liu, Jinming, et al.
Publicado: (2024)
por: Liu, Jinming, et al.
Publicado: (2024)
Compression Tells Intelligence: Visual Coding, Visual Token Technology, and the Unification
por: Jin, Xin, et al.
Publicado: (2026)
por: Jin, Xin, et al.
Publicado: (2026)
Rate-Distortion-Cognition Controllable Versatile Neural Image Compression
por: Liu, Jinming, et al.
Publicado: (2024)
por: Liu, Jinming, et al.
Publicado: (2024)
Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
por: Liu, Jinming, et al.
Publicado: (2025)
por: Liu, Jinming, et al.
Publicado: (2025)
LMM-driven Semantic Image-Text Coding for Ultra Low-bitrate Learned Image Compression
por: Murai, Shimon, et al.
Publicado: (2024)
por: Murai, Shimon, et al.
Publicado: (2024)
Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior
por: Feng, Ruoyu, et al.
Publicado: (2025)
por: Feng, Ruoyu, et al.
Publicado: (2025)
Extremely low-bitrate Image Compression Semantically Disentangled by LMMs from a Human Perception Perspective
por: Song, Juan, et al.
Publicado: (2025)
por: Song, Juan, et al.
Publicado: (2025)
When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
por: Liu, Jinming, et al.
Publicado: (2025)
por: Liu, Jinming, et al.
Publicado: (2025)
Hierarchical Context Alignment with Disentangled Geometric and Temporal Modeling for Semantic Occupancy Prediction
por: Li, Bohan, et al.
Publicado: (2024)
por: Li, Bohan, et al.
Publicado: (2024)
Semantically Structured Image Compression via Irregular Group-Based Decoupling
por: Feng, Ruoyu, et al.
Publicado: (2023)
por: Feng, Ruoyu, et al.
Publicado: (2023)
Generation Navigator: A State-Aware Agentic Framework for Image Generation
por: Liu, Jinming, et al.
Publicado: (2026)
por: Liu, Jinming, et al.
Publicado: (2026)
SpatialCodec: Neural Spatial Speech Coding
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
OmniCodec: Low Frame Rate Universal Audio Codec with Semantic-Acoustic Disentanglement
por: Hu, Jingbin, et al.
Publicado: (2026)
por: Hu, Jingbin, et al.
Publicado: (2026)
Survey on Visual Signal Coding and Processing with Generative Models: Technologies, Standards and Optimization
por: Chen, Zhibo, et al.
Publicado: (2024)
por: Chen, Zhibo, et al.
Publicado: (2024)
Disentangling Uncertainties by Learning Compressed Data Representation
por: An, Zhiyu, et al.
Publicado: (2025)
por: An, Zhiyu, et al.
Publicado: (2025)
Why Compress What You Can Generate? When GPT-4o Generation Ushers in Image Compression Fields
por: Gao, Yixin, et al.
Publicado: (2025)
por: Gao, Yixin, et al.
Publicado: (2025)
SPG-Codec: Exploring the Role and Boundaries of Semantic Priors in Ultra-Low-Bitrate Neural Speech Coding
por: Zhao, Mingyu, et al.
Publicado: (2026)
por: Zhao, Mingyu, et al.
Publicado: (2026)
Closed-Loop Unsupervised Representation Disentanglement with $β$-VAE Distillation and Diffusion Probabilistic Feedback
por: Jin, Xin, et al.
Publicado: (2024)
por: Jin, Xin, et al.
Publicado: (2024)
MMSearch-R1: Incentivizing LMMs to Search
por: Wu, Jinming, et al.
Publicado: (2025)
por: Wu, Jinming, et al.
Publicado: (2025)
NaviNeRF: NeRF-based 3D Representation Disentanglement by Latent Semantic Navigation
por: Xie, Baao, et al.
Publicado: (2023)
por: Xie, Baao, et al.
Publicado: (2023)
Embedding Compression Distortion in Video Coding for Machines
por: Sun, Yuxiao, et al.
Publicado: (2025)
por: Sun, Yuxiao, et al.
Publicado: (2025)
StableCodec: Taming One-Step Diffusion for Extreme Image Compression
por: Zhang, Tianyu, et al.
Publicado: (2025)
por: Zhang, Tianyu, et al.
Publicado: (2025)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
Scene Graph Disentanglement and Composition for Generalizable Complex Image Generation
por: Wang, Yunnan, et al.
Publicado: (2024)
por: Wang, Yunnan, et al.
Publicado: (2024)
Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
por: Ye, Zhen, et al.
Publicado: (2024)
por: Ye, Zhen, et al.
Publicado: (2024)
Teaching LMMs for Image Quality Scoring and Interpreting
por: Zhang, Zicheng, et al.
Publicado: (2025)
por: Zhang, Zicheng, et al.
Publicado: (2025)
Accelerating Learnt Video Codecs with Gradient Decay and Layer-wise Distillation
por: Peng, Tianhao, et al.
Publicado: (2023)
por: Peng, Tianhao, et al.
Publicado: (2023)
An Item is Worth a Prompt: Versatile Image Editing with Disentangled Control
por: Feng, Aosong, et al.
Publicado: (2024)
por: Feng, Aosong, et al.
Publicado: (2024)
DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners
por: Luo, Xiaoxue, et al.
Publicado: (2025)
por: Luo, Xiaoxue, et al.
Publicado: (2025)
A Secret Worth Telling: The Salivary Secret (Ory) Affair
por: Monika Singh, et al.
Publicado: (2026)
por: Monika Singh, et al.
Publicado: (2026)
Diffusion Models for Image Restoration and Enhancement: A Comprehensive Survey
por: Li, Xin, et al.
Publicado: (2023)
por: Li, Xin, et al.
Publicado: (2023)
Disentangled World Models: Learning to Transfer Semantic Knowledge from Distracting Videos for Reinforcement Learning
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
Beyond Single Frames: Can LMMs Comprehend Temporal and Contextual Narratives in Image Sequences?
por: Wang, Xiaochen, et al.
Publicado: (2025)
por: Wang, Xiaochen, et al.
Publicado: (2025)
SCENE: Semantic-aware Codec Enhancement with Neural Embeddings
por: Lin, Han-Yu, et al.
Publicado: (2026)
por: Lin, Han-Yu, et al.
Publicado: (2026)
CMamba: Learned Image Compression with State Space Models
por: Wu, Zhuojie, et al.
Publicado: (2025)
por: Wu, Zhuojie, et al.
Publicado: (2025)
What's an MLIS Worth?
por: Maatta, Stephanie
Publicado: (2007)
por: Maatta, Stephanie
Publicado: (2007)
Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining
por: Zhang, Wenyao, et al.
Publicado: (2026)
por: Zhang, Wenyao, et al.
Publicado: (2026)
Stereo Image Coding for Machines with Joint Visual Feature Compression
por: Jin, Dengchao, et al.
Publicado: (2025)
por: Jin, Dengchao, et al.
Publicado: (2025)
VisualCritic: Making LMMs Perceive Visual Quality Like Humans
por: Huang, Zhipeng, et al.
Publicado: (2024)
por: Huang, Zhipeng, et al.
Publicado: (2024)
One at a Time: Progressive Multi-step Volumetric Probability Learning for Reliable 3D Scene Perception
por: Li, Bohan, et al.
Publicado: (2023)
por: Li, Bohan, et al.
Publicado: (2023)
Ejemplares similares
-
Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion
por: Liu, Jinming, et al.
Publicado: (2024) -
Compression Tells Intelligence: Visual Coding, Visual Token Technology, and the Unification
por: Jin, Xin, et al.
Publicado: (2026) -
Rate-Distortion-Cognition Controllable Versatile Neural Image Compression
por: Liu, Jinming, et al.
Publicado: (2024) -
Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
por: Liu, Jinming, et al.
Publicado: (2025) -
LMM-driven Semantic Image-Text Coding for Ultra Low-bitrate Learned Image Compression
por: Murai, Shimon, et al.
Publicado: (2024)