Saved in:
| Main Authors: | Liang, Guotao, Zhang, Baoquan, Wang, Yaowei, Li, Xutao, Ye, Yunming, Wang, Huaibin, Luo, Chuyao, Ye, Kola, Luo, linfeng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2405.14206 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Codebook Transfer with Part-of-Speech for Vector-Quantized Image Modeling
by: Zhang, Baoquan, et al.
Published: (2024)
by: Zhang, Baoquan, et al.
Published: (2024)
Towards Improved Text-Aligned Codebook Learning: Multi-Hierarchical Codebook-Text Alignment with Long Text
by: Liang, Guotao, et al.
Published: (2025)
by: Liang, Guotao, et al.
Published: (2025)
MCSDNet: Mesoscale Convective System Detection Network via Multi-scale Spatiotemporal Information
by: Liang, Jiajun, et al.
Published: (2024)
by: Liang, Jiajun, et al.
Published: (2024)
DiffCast: A Unified Framework via Residual Diffusion for Precipitation Nowcasting
by: Yu, Demin, et al.
Published: (2023)
by: Yu, Demin, et al.
Published: (2023)
Head-Aware Key-Value Compression for Efficient Autoregressive Image Generation
by: Liang, Guotao, et al.
Published: (2026)
by: Liang, Guotao, et al.
Published: (2026)
Improved Masked Image Generation with Knowledge-Augmented Token Representations
by: Liang, Guotao, et al.
Published: (2025)
by: Liang, Guotao, et al.
Published: (2025)
HPCR: Holistic Proxy-based Contrastive Replay for Online Continual Learning
by: Lin, Huiwei, et al.
Published: (2023)
by: Lin, Huiwei, et al.
Published: (2023)
Prototype Optimization with Neural ODE for Few-Shot Learning
by: Zhang, Baoquan, et al.
Published: (2024)
by: Zhang, Baoquan, et al.
Published: (2024)
SJD-VP: Speculative Jacobi Decoding with Verification Prediction for Autoregressive Image Generation
by: Shan, Bingqi, et al.
Published: (2026)
by: Shan, Bingqi, et al.
Published: (2026)
SJD-PV: Speculative Jacobi Decoding with Phrase Verification for Autoregressive Image Generation
by: Yu, Zhehao, et al.
Published: (2026)
by: Yu, Zhehao, et al.
Published: (2026)
AsyncDSB: Schedule-Asynchronous Diffusion Schrödinger Bridge for Image Inpainting
by: Han, Zihao, et al.
Published: (2024)
by: Han, Zihao, et al.
Published: (2024)
Dual Codebook VQ: Enhanced Image Reconstruction with Reduced Codebook Size
by: Malidarreh, Parisa Boodaghi, et al.
Published: (2025)
by: Malidarreh, Parisa Boodaghi, et al.
Published: (2025)
S2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domain
by: Zhang, Baoquan, et al.
Published: (2026)
by: Zhang, Baoquan, et al.
Published: (2026)
StyleMark: A Robust Watermarking Method for Art Style Images Against Black-Box Arbitrary Style Transfer
by: Zhang, Yunming, et al.
Published: (2024)
by: Zhang, Yunming, et al.
Published: (2024)
Trinity Detector:text-assisted and attention mechanisms based spectral fusion for diffusion generation image detection
by: Song, Jiawei, et al.
Published: (2024)
by: Song, Jiawei, et al.
Published: (2024)
GeoSplatting: Towards Geometry Guided Gaussian Splatting for Physically-based Inverse Rendering
by: Ye, Kai, et al.
Published: (2024)
by: Ye, Kai, et al.
Published: (2024)
AVT2-DWF: Improving Deepfake Detection with Audio-Visual Fusion and Dynamic Weighting Strategies
by: Wang, Rui, et al.
Published: (2024)
by: Wang, Rui, et al.
Published: (2024)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
by: Zheng, Sipeng, et al.
Published: (2024)
by: Zheng, Sipeng, et al.
Published: (2024)
MetaDiff: Meta-Learning with Conditional Diffusion for Few-Shot Learning
by: Zhang, Baoquan, et al.
Published: (2023)
by: Zhang, Baoquan, et al.
Published: (2023)
CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks
by: Luo, Mingshuang, et al.
Published: (2026)
by: Luo, Mingshuang, et al.
Published: (2026)
Domain Generalization via Discrete Codebook Learning
by: Long, Shaocong, et al.
Published: (2025)
by: Long, Shaocong, et al.
Published: (2025)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
by: Wang, Zhaozhi, et al.
Published: (2025)
by: Wang, Zhaozhi, et al.
Published: (2025)
The Less You Depend, The More You Learn: Synthesizing Novel Views from Sparse, Unposed Images with Minimal 3D Knowledge
by: Wang, Haoru, et al.
Published: (2025)
by: Wang, Haoru, et al.
Published: (2025)
Regressor-Segmenter Mutual Prompt Learning for Crowd Counting
by: Guo, Mingyue, et al.
Published: (2023)
by: Guo, Mingyue, et al.
Published: (2023)
LG-Gaze: Learning Geometry-aware Continuous Prompts for Language-Guided Gaze Estimation
by: Yin, Pengwei, et al.
Published: (2024)
by: Yin, Pengwei, et al.
Published: (2024)
Conceptual Codebook Learning for Vision-Language Models
by: Zhang, Yi, et al.
Published: (2024)
by: Zhang, Yi, et al.
Published: (2024)
HyperVQ: Enabling Hyperprior Entropy Modeling for VQ-Based Generative Image Compression
by: Yi, Niu, et al.
Published: (2025)
by: Yi, Niu, et al.
Published: (2025)
GaussianDiffusion: 3D Gaussian Splatting for Denoising Diffusion Probabilistic Models with Structured Noise
by: Li, Xinhai, et al.
Published: (2023)
by: Li, Xinhai, et al.
Published: (2023)
CodeMerge: Codebook-Guided Model Merging for Robust Test-Time Adaptation in Autonomous Driving
by: Yang, Huitong, et al.
Published: (2025)
by: Yang, Huitong, et al.
Published: (2025)
DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering
by: Luo, Jingzhou, et al.
Published: (2025)
by: Luo, Jingzhou, et al.
Published: (2025)
LG-CD: Enhancing Language-Guided Change Detection through SAM2 Adaptation
by: Liu, Yixiao, et al.
Published: (2025)
by: Liu, Yixiao, et al.
Published: (2025)
VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
by: Chen, Xinyu, et al.
Published: (2025)
by: Chen, Xinyu, et al.
Published: (2025)
Virtual Classification: Modulating Domain-Specific Knowledge for Multidomain Crowd Counting
by: Guo, Mingyue, et al.
Published: (2024)
by: Guo, Mingyue, et al.
Published: (2024)
CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering
by: Li, Qiming, et al.
Published: (2026)
by: Li, Qiming, et al.
Published: (2026)
Deep LG-Track: An Enhanced Localization-Confidence-Guided Multi-Object Tracker
by: Meng, Ting, et al.
Published: (2025)
by: Meng, Ting, et al.
Published: (2025)
The NeRF Signature: Codebook-Aided Watermarking for Neural Radiance Fields
by: Luo, Ziyuan, et al.
Published: (2025)
by: Luo, Ziyuan, et al.
Published: (2025)
Building Vision Models upon Heat Conduction
by: Wang, Zhaozhi, et al.
Published: (2024)
by: Wang, Zhaozhi, et al.
Published: (2024)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
by: Cao, Sihan, et al.
Published: (2026)
by: Cao, Sihan, et al.
Published: (2026)
CoBooM: Codebook Guided Bootstrapping for Medical Image Representation Learning
by: Singh, Azad, et al.
Published: (2024)
by: Singh, Azad, et al.
Published: (2024)
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
by: Liang, Chen, et al.
Published: (2022)
by: Liang, Chen, et al.
Published: (2022)
Similar Items
-
Codebook Transfer with Part-of-Speech for Vector-Quantized Image Modeling
by: Zhang, Baoquan, et al.
Published: (2024) -
Towards Improved Text-Aligned Codebook Learning: Multi-Hierarchical Codebook-Text Alignment with Long Text
by: Liang, Guotao, et al.
Published: (2025) -
MCSDNet: Mesoscale Convective System Detection Network via Multi-scale Spatiotemporal Information
by: Liang, Jiajun, et al.
Published: (2024) -
DiffCast: A Unified Framework via Residual Diffusion for Precipitation Nowcasting
by: Yu, Demin, et al.
Published: (2023) -
Head-Aware Key-Value Compression for Efficient Autoregressive Image Generation
by: Liang, Guotao, et al.
Published: (2026)