Enregistré dans:
| Auteurs principaux: | Gao, Yu, Huang, Jiancheng, Sun, Xiaopeng, Jie, Zequn, Zhong, Yujie, Ma, Lin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2405.03025 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MRStyle: A Unified Framework for Color Style Transfer with Multi-Modality Reference
par: Huang, Jiancheng, et autres
Publié: (2024)
par: Huang, Jiancheng, et autres
Publié: (2024)
M4V: Multi-Modal Mamba for Text-to-Video Generation
par: Huang, Jiancheng, et autres
Publié: (2025)
par: Huang, Jiancheng, et autres
Publié: (2025)
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
par: Feng, Chengjian, et autres
Publié: (2024)
par: Feng, Chengjian, et autres
Publié: (2024)
RFSR: Improving ISR Diffusion Models via Reward Feedback Learning
par: Sun, Xiaopeng, et autres
Publié: (2024)
par: Sun, Xiaopeng, et autres
Publié: (2024)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
par: Chen, Lei, et autres
Publié: (2024)
par: Chen, Lei, et autres
Publié: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
par: Lan, Xiaohan, et autres
Publié: (2024)
par: Lan, Xiaohan, et autres
Publié: (2024)
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
par: Chen, Shaoxiang, et autres
Publié: (2024)
par: Chen, Shaoxiang, et autres
Publié: (2024)
Cross-Modal Attention Calibration for LVLM Hallucination Mitigation
par: Li, Jiaming, et autres
Publié: (2025)
par: Li, Jiaming, et autres
Publié: (2025)
TASR: Timestep-Aware Diffusion Model for Image Super-Resolution
par: Lin, Qinwei, et autres
Publié: (2024)
par: Lin, Qinwei, et autres
Publié: (2024)
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
par: Huang, Zhijian, et autres
Publié: (2024)
par: Huang, Zhijian, et autres
Publié: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
par: Chen, Shimin, et autres
Publié: (2024)
par: Chen, Shimin, et autres
Publié: (2024)
FlexVAR: Flexible Visual Autoregressive Modeling without Residual Prediction
par: Jiao, Siyu, et autres
Publié: (2025)
par: Jiao, Siyu, et autres
Publié: (2025)
TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability
par: Chen, Shimin, et autres
Publié: (2024)
par: Chen, Shimin, et autres
Publié: (2024)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
AP-CAP: Advancing High-Quality Data Synthesis for Animal Pose Estimation via a Controllable Image Generation Pipeline
par: Wang, Lei, et autres
Publié: (2025)
par: Wang, Lei, et autres
Publié: (2025)
DisTime: Distribution-based Time Representation for Video Large Language Models
par: Zeng, Yingsen, et autres
Publié: (2025)
par: Zeng, Yingsen, et autres
Publié: (2025)
AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement Learning
par: Huang, Duojun, et autres
Publié: (2024)
par: Huang, Duojun, et autres
Publié: (2024)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
par: Han, Haonan, et autres
Publié: (2026)
par: Han, Haonan, et autres
Publié: (2026)
STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
par: Qin, Jie, et autres
Publié: (2025)
par: Qin, Jie, et autres
Publié: (2025)
MagicFight: Personalized Martial Arts Combat Video Generation
par: Huang, Jiancheng, et autres
Publié: (2026)
par: Huang, Jiancheng, et autres
Publié: (2026)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
par: Jiao, Yang, et autres
Publié: (2024)
par: Jiao, Yang, et autres
Publié: (2024)
Rethinking Efficient and Effective Point-based Networks for Event Camera Classification and Regression: EventMamba
par: Ren, Hongwei, et autres
Publié: (2024)
par: Ren, Hongwei, et autres
Publié: (2024)
DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation
par: Hu, Jie, et autres
Publié: (2026)
par: Hu, Jie, et autres
Publié: (2026)
Trajectory Mamba: Efficient Attention-Mamba Forecasting Model Based on Selective SSM
par: Huang, Yizhou, et autres
Publié: (2025)
par: Huang, Yizhou, et autres
Publié: (2025)
Vivim: a Video Vision Mamba for Medical Video Segmentation
par: Yang, Yijun, et autres
Publié: (2024)
par: Yang, Yijun, et autres
Publié: (2024)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Making Large Language Models Better Planners with Reasoning-Decision Alignment
par: Huang, Zhijian, et autres
Publié: (2024)
par: Huang, Zhijian, et autres
Publié: (2024)
Demystify Mamba in Vision: A Linear Attention Perspective
par: Han, Dongchen, et autres
Publié: (2024)
par: Han, Dongchen, et autres
Publié: (2024)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization
par: Li, Jinlong, et autres
Publié: (2024)
par: Li, Jinlong, et autres
Publié: (2024)
Orthogonal Projection Subspace to Aggregate Online Prior-knowledge for Continual Test-time Adaptation
par: Li, Jinlong, et autres
Publié: (2025)
par: Li, Jinlong, et autres
Publié: (2025)
MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
par: Wu, Tao, et autres
Publié: (2025)
par: Wu, Tao, et autres
Publié: (2025)
SEMA: a Scalable and Efficient Mamba like Attention via Token Localization and Averaging
par: Tran, Nhat Thanh, et autres
Publié: (2025)
par: Tran, Nhat Thanh, et autres
Publié: (2025)
CONQUER: Context-Aware Representation with Query Enhancement for Text-Based Person Search
par: Xie, Zequn
Publié: (2026)
par: Xie, Zequn
Publié: (2026)
Training-free and Adaptive Sparse Attention for Efficient Long Video Generation
par: Xia, Yifei, et autres
Publié: (2025)
par: Xia, Yifei, et autres
Publié: (2025)
FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing
par: Cai, Mingshu, et autres
Publié: (2025)
par: Cai, Mingshu, et autres
Publié: (2025)
Q-MambaIR: Accurate Quantized Mamba for Efficient Image Restoration
par: Chen, Yujie, et autres
Publié: (2025)
par: Chen, Yujie, et autres
Publié: (2025)
Training-free Token Reduction for Vision Mamba
par: Ma, Qiankun, et autres
Publié: (2025)
par: Ma, Qiankun, et autres
Publié: (2025)
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
par: Chen, Haoxing, et autres
Publié: (2024)
par: Chen, Haoxing, et autres
Publié: (2024)
LaMamba-Diff: Linear-Time High-Fidelity Diffusion Models Based on Local Attention and Mamba
par: Fu, Yunxiang, et autres
Publié: (2024)
par: Fu, Yunxiang, et autres
Publié: (2024)
Documents similaires
-
MRStyle: A Unified Framework for Color Style Transfer with Multi-Modality Reference
par: Huang, Jiancheng, et autres
Publié: (2024) -
M4V: Multi-Modal Mamba for Text-to-Video Generation
par: Huang, Jiancheng, et autres
Publié: (2025) -
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
par: Feng, Chengjian, et autres
Publié: (2024) -
RFSR: Improving ISR Diffusion Models via Reward Feedback Learning
par: Sun, Xiaopeng, et autres
Publié: (2024) -
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
par: Chen, Lei, et autres
Publié: (2024)