Guardado en:
| Autores principales: | Liu, Jinming, Huang, Jianguo, Jia, Zhaoyang, Li, Jiahao, Zhang, Xiaoyi, Guo, Zongyu, Li, Bin, Zeng, Wenjun, Lu, Yan, Jin, Xin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.17921 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
por: Zhang, Xiaoyi, et al.
Publicado: (2025)
por: Zhang, Xiaoyi, et al.
Publicado: (2025)
Generative Latent Video Compression
por: Guo, Zongyu, et al.
Publicado: (2025)
por: Guo, Zongyu, et al.
Publicado: (2025)
When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
por: Liu, Jinming, et al.
Publicado: (2025)
por: Liu, Jinming, et al.
Publicado: (2025)
Generative Video Compression with One-Dimensional Latent Representation
por: Zheng, Zihan, et al.
Publicado: (2026)
por: Zheng, Zihan, et al.
Publicado: (2026)
CoD: A Diffusion Foundation Model for Image Compression
por: Jia, Zhaoyang, et al.
Publicado: (2025)
por: Jia, Zhaoyang, et al.
Publicado: (2025)
CoD-Lite: Real-Time Diffusion-Based Generative Image Compression
por: Jia, Zhaoyang, et al.
Publicado: (2026)
por: Jia, Zhaoyang, et al.
Publicado: (2026)
Generation Navigator: A State-Aware Agentic Framework for Image Generation
por: Liu, Jinming, et al.
Publicado: (2026)
por: Liu, Jinming, et al.
Publicado: (2026)
Efficient Autoregressive Video Diffusion with Dummy Head
por: Guo, Hang, et al.
Publicado: (2026)
por: Guo, Hang, et al.
Publicado: (2026)
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
por: Zhang, Ziyun, et al.
Publicado: (2026)
por: Zhang, Ziyun, et al.
Publicado: (2026)
Generative Latent Coding for Ultra-Low Bitrate Image and Video Compression
por: Qi, Linfeng, et al.
Publicado: (2025)
por: Qi, Linfeng, et al.
Publicado: (2025)
Towards Practical Real-Time Neural Video Compression
por: Jia, Zhaoyang, et al.
Publicado: (2025)
por: Jia, Zhaoyang, et al.
Publicado: (2025)
Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
por: Xue, Naifu, et al.
Publicado: (2025)
por: Xue, Naifu, et al.
Publicado: (2025)
Generative Latent Coding for Ultra-Low Bitrate Image Compression
por: Jia, Zhaoyang, et al.
Publicado: (2025)
por: Jia, Zhaoyang, et al.
Publicado: (2025)
Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
por: Li, Jialuo, et al.
Publicado: (2025)
por: Li, Jialuo, et al.
Publicado: (2025)
Neural Video Compression with Feature Modulation
por: Li, Jiahao, et al.
Publicado: (2024)
por: Li, Jiahao, et al.
Publicado: (2024)
One-Step Diffusion-Based Image Compression with Semantic Distillation
por: Xue, Naifu, et al.
Publicado: (2025)
por: Xue, Naifu, et al.
Publicado: (2025)
DLF: Extreme Image Compression with Dual-generative Latent Fusion
por: Xue, Naifu, et al.
Publicado: (2025)
por: Xue, Naifu, et al.
Publicado: (2025)
A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding
por: Zhang, Yue, et al.
Publicado: (2026)
por: Zhang, Yue, et al.
Publicado: (2026)
Compression Tells Intelligence: Visual Coding, Visual Token Technology, and the Unification
por: Jin, Xin, et al.
Publicado: (2026)
por: Jin, Xin, et al.
Publicado: (2026)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
por: Zeng, Xiangyu, et al.
Publicado: (2025)
por: Zeng, Xiangyu, et al.
Publicado: (2025)
Uncertainty-Aware Deep Video Compression with Ensembles
por: Ma, Wufei, et al.
Publicado: (2024)
por: Ma, Wufei, et al.
Publicado: (2024)
Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding
por: Huang, Yanxiang, et al.
Publicado: (2026)
por: Huang, Yanxiang, et al.
Publicado: (2026)
Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding
por: Gao, Hong, et al.
Publicado: (2025)
por: Gao, Hong, et al.
Publicado: (2025)
Rate-Distortion-Cognition Controllable Versatile Neural Image Compression
por: Liu, Jinming, et al.
Publicado: (2024)
por: Liu, Jinming, et al.
Publicado: (2024)
LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval
por: Ning, Zhenyu, et al.
Publicado: (2025)
por: Ning, Zhenyu, et al.
Publicado: (2025)
Streaming Long Video Understanding with Large Language Models
por: Qian, Rui, et al.
Publicado: (2024)
por: Qian, Rui, et al.
Publicado: (2024)
One at a Time: Progressive Multi-step Volumetric Probability Learning for Reliable 3D Scene Perception
por: Li, Bohan, et al.
Publicado: (2023)
por: Li, Bohan, et al.
Publicado: (2023)
Agentic Very Long Video Understanding
por: Rege, Aniket, et al.
Publicado: (2026)
por: Rege, Aniket, et al.
Publicado: (2026)
MAL: Cluster-Masked and Multi-Task Pretraining for Enhanced xLSTM Vision Performance
por: Huang, Wenjun, et al.
Publicado: (2024)
por: Huang, Wenjun, et al.
Publicado: (2024)
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search
por: Yin, Xinlei, et al.
Publicado: (2026)
por: Yin, Xinlei, et al.
Publicado: (2026)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
por: Dong, Xin, et al.
Publicado: (2024)
por: Dong, Xin, et al.
Publicado: (2024)
Closed-Loop Unsupervised Representation Disentanglement with $β$-VAE Distillation and Diffusion Probabilistic Feedback
por: Jin, Xin, et al.
Publicado: (2024)
por: Jin, Xin, et al.
Publicado: (2024)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
por: Wang, Junxi, et al.
Publicado: (2026)
por: Wang, Junxi, et al.
Publicado: (2026)
Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion
por: Liu, Jinming, et al.
Publicado: (2024)
por: Liu, Jinming, et al.
Publicado: (2024)
Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
por: Chen, Guo, et al.
Publicado: (2024)
por: Chen, Guo, et al.
Publicado: (2024)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
por: Chen, Xueyi, et al.
Publicado: (2025)
por: Chen, Xueyi, et al.
Publicado: (2025)
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
por: Lu, Xudong, et al.
Publicado: (2026)
por: Lu, Xudong, et al.
Publicado: (2026)
VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers
por: Li, Ruanjun, et al.
Publicado: (2025)
por: Li, Ruanjun, et al.
Publicado: (2025)
A Coding Framework and Benchmark towards Low-Bitrate Video Understanding
por: Tian, Yuan, et al.
Publicado: (2022)
por: Tian, Yuan, et al.
Publicado: (2022)
Ejemplares similares
-
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
por: Zhang, Xiaoyi, et al.
Publicado: (2025) -
Generative Latent Video Compression
por: Guo, Zongyu, et al.
Publicado: (2025) -
When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
por: Liu, Jinming, et al.
Publicado: (2025) -
Generative Video Compression with One-Dimensional Latent Representation
por: Zheng, Zihan, et al.
Publicado: (2026) -
CoD: A Diffusion Foundation Model for Image Compression
por: Jia, Zhaoyang, et al.
Publicado: (2025)