HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peng, Zelin, Xu, Zhengqin, Liu, Qingyang, Yang, Xiaokang, Shen, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Parameter-efficient Fine-tuning in Hyperspherical Space for Open-vocabulary Semantic Segmentation
par: Peng, Zelin, et autres
Publié: (2024)
par: Peng, Zelin, et autres
Publié: (2024)
NEARL-CLIP: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding
par: Peng, Zelin, et autres
Publié: (2025)
par: Peng, Zelin, et autres
Publié: (2025)
Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything Model
par: Peng, Zelin, et autres
Publié: (2023)
par: Peng, Zelin, et autres
Publié: (2023)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
par: Huang, Yu, et autres
Publié: (2025)
par: Huang, Yu, et autres
Publié: (2025)
Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning
par: Si, Chongjie, et autres
Publié: (2024)
par: Si, Chongjie, et autres
Publié: (2024)
Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge
par: Huang, Yu, et autres
Publié: (2025)
par: Huang, Yu, et autres
Publié: (2025)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
par: Chow, Wei, et autres
Publié: (2024)
par: Chow, Wei, et autres
Publié: (2024)
Empowering Segmentation Ability to Multi-modal Large Language Models
par: Yang, Yuqi, et autres
Publié: (2024)
par: Yang, Yuqi, et autres
Publié: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
par: HyperAI Team, et autres
Publié: (2025)
par: HyperAI Team, et autres
Publié: (2025)
TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models
par: Zheng, Xiangtian, et autres
Publié: (2026)
par: Zheng, Xiangtian, et autres
Publié: (2026)
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
par: Wei, Cong, et autres
Publié: (2024)
par: Wei, Cong, et autres
Publié: (2024)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
par: Huang, Wencan, et autres
Publié: (2025)
par: Huang, Wencan, et autres
Publié: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
par: Wei, Cong, et autres
Publié: (2024)
par: Wei, Cong, et autres
Publié: (2024)
DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models
par: Xia, Renqiu, et autres
Publié: (2024)
par: Xia, Renqiu, et autres
Publié: (2024)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Efficient Multi-modal Large Language Models via Visual Token Grouping
par: Huang, Minbin, et autres
Publié: (2024)
par: Huang, Minbin, et autres
Publié: (2024)
Efficient Multi-modal Long Context Learning for Training-free Adaptation
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
Efficient Large Multi-modal Models via Visual Context Compression
par: Chen, Jieneng, et autres
Publié: (2024)
par: Chen, Jieneng, et autres
Publié: (2024)
LLMRA: Multi-modal Large Language Model based Restoration Assistant
par: Jin, Xiaoyu, et autres
Publié: (2024)
par: Jin, Xiaoyu, et autres
Publié: (2024)
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
par: Wang, Zining, et autres
Publié: (2025)
par: Wang, Zining, et autres
Publié: (2025)
Vision-Informed Flow Image Super-Resolution with Quaternion Spatial Modeling and Dynamic Flow Convolution
par: Cao, Qinglong, et autres
Publié: (2024)
par: Cao, Qinglong, et autres
Publié: (2024)
HyperST: Hierarchical Hyperbolic Learning for Spatial Transcriptomics Prediction
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
Distilling Multi-modal Large Language Models for Autonomous Driving
par: Hegde, Deepti, et autres
Publié: (2025)
par: Hegde, Deepti, et autres
Publié: (2025)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
par: Yang, Morunliu, et autres
Publié: (2026)
par: Yang, Morunliu, et autres
Publié: (2026)
HyperPath: Knowledge-Guided Hyperbolic Semantic Hierarchy Modeling for WSI Analysis
par: Huang, Peixiang, et autres
Publié: (2025)
par: Huang, Peixiang, et autres
Publié: (2025)
Point Cloud as a Foreign Language for Multi-modal Large Language Model
par: Paul, Sneha, et autres
Publié: (2026)
par: Paul, Sneha, et autres
Publié: (2026)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
par: Jiang, Dongsheng, et autres
Publié: (2023)
par: Jiang, Dongsheng, et autres
Publié: (2023)
Adapting Multi-modal Large Language Model to Concept Drift From Pre-training Onwards
par: Yang, Xiaoyu, et autres
Publié: (2024)
par: Yang, Xiaoyu, et autres
Publié: (2024)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
par: Xu, Weiye, et autres
Publié: (2025)
par: Xu, Weiye, et autres
Publié: (2025)
FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance
par: Wang, Haicheng, et autres
Publié: (2025)
par: Wang, Haicheng, et autres
Publié: (2025)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
par: Jeon, Byungwoo, et autres
Publié: (2026)
par: Jeon, Byungwoo, et autres
Publié: (2026)
Understanding Information Storage and Transfer in Multi-modal Large Language Models
par: Basu, Samyadeep, et autres
Publié: (2024)
par: Basu, Samyadeep, et autres
Publié: (2024)
EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
par: Zhang, Wei, et autres
Publié: (2024)
par: Zhang, Wei, et autres
Publié: (2024)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
par: Liao, Wenhui, et autres
Publié: (2024)
par: Liao, Wenhui, et autres
Publié: (2024)
Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models
par: Yang, Shijun, et autres
Publié: (2025)
par: Yang, Shijun, et autres
Publié: (2025)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
par: Huang, Junming, et autres
Publié: (2026)
par: Huang, Junming, et autres
Publié: (2026)
See Further for Parameter Efficient Fine-tuning by Standing on the Shoulders of Decomposition
par: Si, Chongjie, et autres
Publié: (2024)
par: Si, Chongjie, et autres
Publié: (2024)
Documents similaires
-
Parameter-efficient Fine-tuning in Hyperspherical Space for Open-vocabulary Semantic Segmentation
par: Peng, Zelin, et autres
Publié: (2024) -
NEARL-CLIP: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding
par: Peng, Zelin, et autres
Publié: (2025) -
Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything Model
par: Peng, Zelin, et autres
Publié: (2023) -
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
par: Huang, Yu, et autres
Publié: (2025) -
Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning
par: Si, Chongjie, et autres
Publié: (2024)