Enregistré dans:
| Auteurs principaux: | Shi, Bowen, Zhao, Peisen, Wang, Zichen, Zhang, Yuhang, Wang, Yaoming, Li, Jin, Dai, Wenrui, Zou, Junni, Xiong, Hongkai, Tian, Qi, Zhang, Xiaopeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2401.06397 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
par: Zheng, Guanghao, et autres
Publié: (2025)
par: Zheng, Guanghao, et autres
Publié: (2025)
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
par: Liu, Yuchen, et autres
Publié: (2025)
par: Liu, Yuchen, et autres
Publié: (2025)
Diffusion-Driven Progressive Target Manipulation for Source-Free Domain Adaptation
par: Huang, Yuyang, et autres
Publié: (2025)
par: Huang, Yuyang, et autres
Publié: (2025)
Point Cloud Denoising With Fine-Granularity Dynamic Graph Convolutional Networks
par: Xu, Wenqiang, et autres
Publié: (2024)
par: Xu, Wenqiang, et autres
Publié: (2024)
MimicNorm: Weight Mean and Last BN Layer Mimic the Dynamic of Batch Normalization
par: Fei, Wen, et autres
Publié: (2020)
par: Fei, Wen, et autres
Publié: (2020)
Noise Conditional Variational Score Distillation
par: Peng, Xinyu, et autres
Publié: (2025)
par: Peng, Xinyu, et autres
Publié: (2025)
Frequency-Aware Transformer for Learned Image Compression
par: Li, Han, et autres
Publié: (2023)
par: Li, Han, et autres
Publié: (2023)
Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers
par: Peng, Xinyu, et autres
Publié: (2026)
par: Peng, Xinyu, et autres
Publié: (2026)
Image Compression for Machine and Human Vision with Spatial-Frequency Adaptation
par: Li, Han, et autres
Publié: (2024)
par: Li, Han, et autres
Publié: (2024)
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
par: Li, Han, et autres
Publié: (2025)
par: Li, Han, et autres
Publié: (2025)
Point Cloud Resampling with Learnable Heat Diffusion
par: Xu, Wenqiang, et autres
Publié: (2024)
par: Xu, Wenqiang, et autres
Publié: (2024)
HiPART: Hierarchical Pose AutoRegressive Transformer for Occluded 3D Human Pose Estimation
par: Zheng, Hongwei, et autres
Publié: (2025)
par: Zheng, Hongwei, et autres
Publié: (2025)
Improving Diffusion Models for Inverse Problems Using Optimal Posterior Covariance
par: Peng, Xinyu, et autres
Publié: (2024)
par: Peng, Xinyu, et autres
Publié: (2024)
Error-Propagation-Free Learned Video Compression With Dual-Domain Progressive Temporal Alignment
par: Li, Han, et autres
Publié: (2025)
par: Li, Han, et autres
Publié: (2025)
Information-Theoretic Optimization for Task-Adapted Compressed Sensing Magnetic Resonance Imaging
par: Peng, Xinyu, et autres
Publié: (2026)
par: Peng, Xinyu, et autres
Publié: (2026)
3DGabSplat: 3D Gabor Splatting for Frequency-adaptive Radiance Field Rendering
par: Zhou, Junyu, et autres
Publié: (2025)
par: Zhou, Junyu, et autres
Publié: (2025)
On Disentangled Training for Nonlinear Transform in Learned Image Compression
par: Li, Han, et autres
Publié: (2025)
par: Li, Han, et autres
Publié: (2025)
LiftImage3D: Lifting Any Single Image to 3D Gaussians with Video Generation Priors
par: Chen, Yabo, et autres
Publié: (2024)
par: Chen, Yabo, et autres
Publié: (2024)
Cascade-Zero123: One Image to Highly Consistent 3D with Self-Prompted Nearby Views
par: Chen, Yabo, et autres
Publié: (2023)
par: Chen, Yabo, et autres
Publié: (2023)
CEIA: CLIP-Based Event-Image Alignment for Open-World Event-Based Understanding
par: Xu, Wenhao, et autres
Publié: (2024)
par: Xu, Wenhao, et autres
Publié: (2024)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
par: Jiang, Dongsheng, et autres
Publié: (2023)
par: Jiang, Dongsheng, et autres
Publié: (2023)
DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
par: Ren, Tianhe, et autres
Publié: (2024)
par: Ren, Tianhe, et autres
Publié: (2024)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks
par: Yang, Min, et autres
Publié: (2024)
par: Yang, Min, et autres
Publié: (2024)
EV-NVC: Efficient Variable bitrate Neural Video Compression
par: Hu, Yongcun, et autres
Publié: (2025)
par: Hu, Yongcun, et autres
Publié: (2025)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
UMind-VL: A Generalist Ultrasound Vision-Language Model for Unified Grounded Perception and Comprehensive Interpretation
par: Chen, Dengbo, et autres
Publié: (2025)
par: Chen, Dengbo, et autres
Publié: (2025)
Unifying Biomedical Vision-Language Expertise: Towards a Generalist Foundation Model via Multi-CLIP Knowledge Distillation
par: Wang, Shansong, et autres
Publié: (2025)
par: Wang, Shansong, et autres
Publié: (2025)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
par: Zhang, Beichen, et autres
Publié: (2024)
par: Zhang, Beichen, et autres
Publié: (2024)
A Low-Rank Method for Vision Language Model Hallucination Mitigation in Autonomous Driving
par: Long, Keke, et autres
Publié: (2025)
par: Long, Keke, et autres
Publié: (2025)
FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions
par: Zhao, Peisen, et autres
Publié: (2026)
par: Zhao, Peisen, et autres
Publié: (2026)
Towards Building Specialized Generalist AI with System 1 and System 2 Fusion
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
Refining Alignment Framework for Diffusion Models with Intermediate-Step Preference Ranking
par: Ren, Jie, et autres
Publié: (2025)
par: Ren, Jie, et autres
Publié: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
par: Xie, Wulin, et autres
Publié: (2025)
par: Xie, Wulin, et autres
Publié: (2025)
Grounded Vision-Language Navigation for UAVs with Open-Vocabulary Goal Understanding
par: Zhang, Yuhang, et autres
Publié: (2025)
par: Zhang, Yuhang, et autres
Publié: (2025)
Res$^2$CLIP: Few-Shot Generalist Anomaly Detection with Residual-to-Residual Alignment
par: Liu, Xinyue, et autres
Publié: (2026)
par: Liu, Xinyue, et autres
Publié: (2026)
MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning
par: Zhang, Wenrui, et autres
Publié: (2025)
par: Zhang, Wenrui, et autres
Publié: (2025)
OpenSDI: Spotting Diffusion-Generated Images in the Open World
par: Wang, Yabin, et autres
Publié: (2025)
par: Wang, Yabin, et autres
Publié: (2025)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
par: LASA Team, et autres
Publié: (2025)
par: LASA Team, et autres
Publié: (2025)
Documents similaires
-
GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
par: Zheng, Guanghao, et autres
Publié: (2025) -
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
par: Liu, Yuchen, et autres
Publié: (2025) -
Diffusion-Driven Progressive Target Manipulation for Source-Free Domain Adaptation
par: Huang, Yuyang, et autres
Publié: (2025) -
Point Cloud Denoising With Fine-Granularity Dynamic Graph Convolutional Networks
par: Xu, Wenqiang, et autres
Publié: (2024) -
MimicNorm: Weight Mean and Last BN Layer Mimic the Dynamic of Batch Normalization
par: Fei, Wen, et autres
Publié: (2020)