HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Peng, Zelin, Xu, Zhengqin, Liu, Qingyang, Yang, Xiaokang, Shen, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Parameter-efficient Fine-tuning in Hyperspherical Space for Open-vocabulary Semantic Segmentation
por: Peng, Zelin, et al.
Publicado: (2024)
por: Peng, Zelin, et al.
Publicado: (2024)
NEARL-CLIP: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding
por: Peng, Zelin, et al.
Publicado: (2025)
por: Peng, Zelin, et al.
Publicado: (2025)
Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything Model
por: Peng, Zelin, et al.
Publicado: (2023)
por: Peng, Zelin, et al.
Publicado: (2023)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
por: Huang, Yu, et al.
Publicado: (2025)
por: Huang, Yu, et al.
Publicado: (2025)
Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning
por: Si, Chongjie, et al.
Publicado: (2024)
por: Si, Chongjie, et al.
Publicado: (2024)
Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge
por: Huang, Yu, et al.
Publicado: (2025)
por: Huang, Yu, et al.
Publicado: (2025)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
por: Chow, Wei, et al.
Publicado: (2024)
por: Chow, Wei, et al.
Publicado: (2024)
Empowering Segmentation Ability to Multi-modal Large Language Models
por: Yang, Yuqi, et al.
Publicado: (2024)
por: Yang, Yuqi, et al.
Publicado: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
por: Zhang, Kaichen, et al.
Publicado: (2024)
por: Zhang, Kaichen, et al.
Publicado: (2024)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
por: HyperAI Team, et al.
Publicado: (2025)
por: HyperAI Team, et al.
Publicado: (2025)
TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models
por: Zheng, Xiangtian, et al.
Publicado: (2026)
por: Zheng, Xiangtian, et al.
Publicado: (2026)
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
por: Wei, Cong, et al.
Publicado: (2024)
por: Wei, Cong, et al.
Publicado: (2024)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
por: Huang, Wencan, et al.
Publicado: (2025)
por: Huang, Wencan, et al.
Publicado: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
por: Wei, Cong, et al.
Publicado: (2024)
por: Wei, Cong, et al.
Publicado: (2024)
DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models
por: Xia, Renqiu, et al.
Publicado: (2024)
por: Xia, Renqiu, et al.
Publicado: (2024)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
Efficient Multi-modal Large Language Models via Visual Token Grouping
por: Huang, Minbin, et al.
Publicado: (2024)
por: Huang, Minbin, et al.
Publicado: (2024)
Efficient Multi-modal Long Context Learning for Training-free Adaptation
por: Ma, Zehong, et al.
Publicado: (2025)
por: Ma, Zehong, et al.
Publicado: (2025)
Efficient Large Multi-modal Models via Visual Context Compression
por: Chen, Jieneng, et al.
Publicado: (2024)
por: Chen, Jieneng, et al.
Publicado: (2024)
LLMRA: Multi-modal Large Language Model based Restoration Assistant
por: Jin, Xiaoyu, et al.
Publicado: (2024)
por: Jin, Xiaoyu, et al.
Publicado: (2024)
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
por: Wang, Zining, et al.
Publicado: (2025)
por: Wang, Zining, et al.
Publicado: (2025)
Vision-Informed Flow Image Super-Resolution with Quaternion Spatial Modeling and Dynamic Flow Convolution
por: Cao, Qinglong, et al.
Publicado: (2024)
por: Cao, Qinglong, et al.
Publicado: (2024)
HyperST: Hierarchical Hyperbolic Learning for Spatial Transcriptomics Prediction
por: Zhang, Chen, et al.
Publicado: (2025)
por: Zhang, Chen, et al.
Publicado: (2025)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Distilling Multi-modal Large Language Models for Autonomous Driving
por: Hegde, Deepti, et al.
Publicado: (2025)
por: Hegde, Deepti, et al.
Publicado: (2025)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
por: Yang, Morunliu, et al.
Publicado: (2026)
por: Yang, Morunliu, et al.
Publicado: (2026)
HyperPath: Knowledge-Guided Hyperbolic Semantic Hierarchy Modeling for WSI Analysis
por: Huang, Peixiang, et al.
Publicado: (2025)
por: Huang, Peixiang, et al.
Publicado: (2025)
Point Cloud as a Foreign Language for Multi-modal Large Language Model
por: Paul, Sneha, et al.
Publicado: (2026)
por: Paul, Sneha, et al.
Publicado: (2026)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
por: Jiang, Dongsheng, et al.
Publicado: (2023)
por: Jiang, Dongsheng, et al.
Publicado: (2023)
Adapting Multi-modal Large Language Model to Concept Drift From Pre-training Onwards
por: Yang, Xiaoyu, et al.
Publicado: (2024)
por: Yang, Xiaoyu, et al.
Publicado: (2024)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
por: Xu, Weiye, et al.
Publicado: (2025)
por: Xu, Weiye, et al.
Publicado: (2025)
FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance
por: Wang, Haicheng, et al.
Publicado: (2025)
por: Wang, Haicheng, et al.
Publicado: (2025)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
por: Jeon, Byungwoo, et al.
Publicado: (2026)
por: Jeon, Byungwoo, et al.
Publicado: (2026)
Understanding Information Storage and Transfer in Multi-modal Large Language Models
por: Basu, Samyadeep, et al.
Publicado: (2024)
por: Basu, Samyadeep, et al.
Publicado: (2024)
EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
por: Liao, Wenhui, et al.
Publicado: (2024)
por: Liao, Wenhui, et al.
Publicado: (2024)
Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models
por: Yang, Shijun, et al.
Publicado: (2025)
por: Yang, Shijun, et al.
Publicado: (2025)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
por: Huang, Junming, et al.
Publicado: (2026)
por: Huang, Junming, et al.
Publicado: (2026)
See Further for Parameter Efficient Fine-tuning by Standing on the Shoulders of Decomposition
por: Si, Chongjie, et al.
Publicado: (2024)
por: Si, Chongjie, et al.
Publicado: (2024)
Ejemplares similares
-
Parameter-efficient Fine-tuning in Hyperspherical Space for Open-vocabulary Semantic Segmentation
por: Peng, Zelin, et al.
Publicado: (2024) -
NEARL-CLIP: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding
por: Peng, Zelin, et al.
Publicado: (2025) -
Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything Model
por: Peng, Zelin, et al.
Publicado: (2023) -
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
por: Huang, Yu, et al.
Publicado: (2025) -
Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning
por: Si, Chongjie, et al.
Publicado: (2024)