Gespeichert in:
| Hauptverfasser: | Liang, Yinan, Wang, Ziwei, Xu, Xiuwei, Zhou, Jie, Lu, Jiwen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2503.15369 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Q-VLM: Post-training Quantization for Large Vision-Language Models
von: Wang, Changyuan, et al.
Veröffentlicht: (2024)
von: Wang, Changyuan, et al.
Veröffentlicht: (2024)
3D Small Object Detection with Dynamic Spatial Pruning
von: Xu, Xiuwei, et al.
Veröffentlicht: (2023)
von: Xu, Xiuwei, et al.
Veröffentlicht: (2023)
TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding
von: Guo, Wenxuan, et al.
Veröffentlicht: (2025)
von: Guo, Wenxuan, et al.
Veröffentlicht: (2025)
Towards Accurate Post-training Quantization for Diffusion Models
von: Wang, Changyuan, et al.
Veröffentlicht: (2023)
von: Wang, Changyuan, et al.
Veröffentlicht: (2023)
Anyview: Generalizable Indoor 3D Object Detection with Variable Frames
von: Wu, Zhenyu, et al.
Veröffentlicht: (2023)
von: Wu, Zhenyu, et al.
Veröffentlicht: (2023)
UniGoal: Towards Universal Zero-shot Goal-oriented Navigation
von: Yin, Hang, et al.
Veröffentlicht: (2025)
von: Yin, Hang, et al.
Veröffentlicht: (2025)
EmbodiedSAM: Online Segment Any 3D Thing in Real Time
von: Xu, Xiuwei, et al.
Veröffentlicht: (2024)
von: Xu, Xiuwei, et al.
Veröffentlicht: (2024)
MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation
von: Wu, Zhenyu, et al.
Veröffentlicht: (2025)
von: Wu, Zhenyu, et al.
Veröffentlicht: (2025)
Memory-based Adapters for Online 3D Scene Perception
von: Xu, Xiuwei, et al.
Veröffentlicht: (2024)
von: Xu, Xiuwei, et al.
Veröffentlicht: (2024)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
von: Ye, Xubing, et al.
Veröffentlicht: (2024)
von: Ye, Xubing, et al.
Veröffentlicht: (2024)
IGL-Nav: Incremental 3D Gaussian Localization for Image-goal Navigation
von: Guo, Wenxuan, et al.
Veröffentlicht: (2025)
von: Guo, Wenxuan, et al.
Veröffentlicht: (2025)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
von: Yin, Hang, et al.
Veröffentlicht: (2025)
von: Yin, Hang, et al.
Veröffentlicht: (2025)
SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation
von: Yin, Hang, et al.
Veröffentlicht: (2024)
von: Yin, Hang, et al.
Veröffentlicht: (2024)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
von: An, Xiang, et al.
Veröffentlicht: (2025)
von: An, Xiang, et al.
Veröffentlicht: (2025)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
von: Huang, Runhui, et al.
Veröffentlicht: (2024)
von: Huang, Runhui, et al.
Veröffentlicht: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
von: Cao, Meng, et al.
Veröffentlicht: (2024)
von: Cao, Meng, et al.
Veröffentlicht: (2024)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
iGaussian: Real-Time Camera Pose Estimation via Feed-Forward 3D Gaussian Splatting Inversion
von: Wang, Hao, et al.
Veröffentlicht: (2025)
von: Wang, Hao, et al.
Veröffentlicht: (2025)
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
von: An, Xiang, et al.
Veröffentlicht: (2026)
von: An, Xiang, et al.
Veröffentlicht: (2026)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
OGGSplat: Open Gaussian Growing for Generalizable Reconstruction with Expanded Field-of-View
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
von: Liu, Zuyan, et al.
Veröffentlicht: (2024)
von: Liu, Zuyan, et al.
Veröffentlicht: (2024)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
von: Lu, Weiheng, et al.
Veröffentlicht: (2024)
von: Lu, Weiheng, et al.
Veröffentlicht: (2024)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
von: Xu, Jinjin, et al.
Veröffentlicht: (2023)
von: Xu, Jinjin, et al.
Veröffentlicht: (2023)
R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation
von: Xu, Xiuwei, et al.
Veröffentlicht: (2025)
von: Xu, Xiuwei, et al.
Veröffentlicht: (2025)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
von: Lin, Bin, et al.
Veröffentlicht: (2024)
von: Lin, Bin, et al.
Veröffentlicht: (2024)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
GlobalMamba: Global Image Serialization for Vision Mamba
von: Wang, Chengkun, et al.
Veröffentlicht: (2024)
von: Wang, Chengkun, et al.
Veröffentlicht: (2024)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
CarLLaVA: Vision language models for camera-only closed-loop driving
von: Renz, Katrin, et al.
Veröffentlicht: (2024)
von: Renz, Katrin, et al.
Veröffentlicht: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
von: An, Ruichuan, et al.
Veröffentlicht: (2025)
von: An, Ruichuan, et al.
Veröffentlicht: (2025)
Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models
von: Zamini, Mohamad, et al.
Veröffentlicht: (2025)
von: Zamini, Mohamad, et al.
Veröffentlicht: (2025)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
von: Inal, Gokce, et al.
Veröffentlicht: (2026)
von: Inal, Gokce, et al.
Veröffentlicht: (2026)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
von: An, Ruichuan, et al.
Veröffentlicht: (2024)
von: An, Ruichuan, et al.
Veröffentlicht: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
von: Li, Bo, et al.
Veröffentlicht: (2024)
von: Li, Bo, et al.
Veröffentlicht: (2024)
MCA-LLaVA: Manhattan Causal Attention for Reducing Hallucination in Large Vision-Language Models
von: Zhao, Qiyan, et al.
Veröffentlicht: (2025)
von: Zhao, Qiyan, et al.
Veröffentlicht: (2025)
Efficient Token Pruning for LLaDA-V
von: Wan, Zhewen, et al.
Veröffentlicht: (2026)
von: Wan, Zhewen, et al.
Veröffentlicht: (2026)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
von: Zhang, Shaolei, et al.
Veröffentlicht: (2025)
von: Zhang, Shaolei, et al.
Veröffentlicht: (2025)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
von: Xu, Guowei, et al.
Veröffentlicht: (2024)
von: Xu, Guowei, et al.
Veröffentlicht: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
von: Guo, Xuechen, et al.
Veröffentlicht: (2024)
von: Guo, Xuechen, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Q-VLM: Post-training Quantization for Large Vision-Language Models
von: Wang, Changyuan, et al.
Veröffentlicht: (2024) -
3D Small Object Detection with Dynamic Spatial Pruning
von: Xu, Xiuwei, et al.
Veröffentlicht: (2023) -
TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding
von: Guo, Wenxuan, et al.
Veröffentlicht: (2025) -
Towards Accurate Post-training Quantization for Diffusion Models
von: Wang, Changyuan, et al.
Veröffentlicht: (2023) -
Anyview: Generalizable Indoor 3D Object Detection with Variable Frames
von: Wu, Zhenyu, et al.
Veröffentlicht: (2023)