Guardado en:
| Autores principales: | Wang, Haixin, Yang, Xinlong, Chang, Jianlong, Jin, Dian, Sun, Jinan, Zhang, Shikun, Luo, Xiao, Tian, Qi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2305.08381 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LION: Implicit Vision Prompt Tuning
por: Wang, Haixin, et al.
Publicado: (2023)
por: Wang, Haixin, et al.
Publicado: (2023)
OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data
por: Zhang, Jinlu, et al.
Publicado: (2025)
por: Zhang, Jinlu, et al.
Publicado: (2025)
Visual Tuning
por: Yu, Bruce X. B., et al.
Publicado: (2023)
por: Yu, Bruce X. B., et al.
Publicado: (2023)
Foundation Model for Endoscopy Video Analysis via Large-scale Self-supervised Pre-train
por: Wang, Zhao, et al.
Publicado: (2023)
por: Wang, Zhao, et al.
Publicado: (2023)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
por: Wu, Jianlong, et al.
Publicado: (2025)
por: Wu, Jianlong, et al.
Publicado: (2025)
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
por: Jia, Hongrui, et al.
Publicado: (2025)
por: Jia, Hongrui, et al.
Publicado: (2025)
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
por: Jia, Hongrui, et al.
Publicado: (2026)
por: Jia, Hongrui, et al.
Publicado: (2026)
PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest
por: Beal, Josh, et al.
Publicado: (2026)
por: Beal, Josh, et al.
Publicado: (2026)
Exploring Parameter-Efficient Fine-Tuning to Enable Foundation Models in Federated Learning
por: Sun, Guangyu, et al.
Publicado: (2022)
por: Sun, Guangyu, et al.
Publicado: (2022)
Large-scale Self-supervised Video Foundation Model for Intelligent Surgery
por: Yang, Shu, et al.
Publicado: (2025)
por: Yang, Shu, et al.
Publicado: (2025)
Attention Prompt Tuning: Parameter-efficient Adaptation of Pre-trained Models for Spatiotemporal Modeling
por: Bandara, Wele Gedara Chaminda, et al.
Publicado: (2024)
por: Bandara, Wele Gedara Chaminda, et al.
Publicado: (2024)
Parameter-Efficient Fine-Tuning of Multispectral Foundation Models for Hyperspectral Image Classification
por: Ligan, Bernardin, et al.
Publicado: (2025)
por: Ligan, Bernardin, et al.
Publicado: (2025)
Introducing Multimodal Paradigm for Learning Sleep Staging PSG via General-Purpose Model
por: Zhou, Jianheng, et al.
Publicado: (2025)
por: Zhou, Jianheng, et al.
Publicado: (2025)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
por: Sun, Haoyuan, et al.
Publicado: (2025)
por: Sun, Haoyuan, et al.
Publicado: (2025)
TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal
por: Wang, Hanting, et al.
Publicado: (2025)
por: Wang, Hanting, et al.
Publicado: (2025)
SpectralX: Parameter-efficient Domain Generalization for Spectral Remote Sensing Foundation Models
por: Zhang, Yuxiang, et al.
Publicado: (2025)
por: Zhang, Yuxiang, et al.
Publicado: (2025)
Generative Multimodal Models are In-Context Learners
por: Sun, Quan, et al.
Publicado: (2023)
por: Sun, Quan, et al.
Publicado: (2023)
HyperFree: A Channel-adaptive and Tuning-free Foundation Model for Hyperspectral Remote Sensing Imagery
por: Li, Jingtao, et al.
Publicado: (2025)
por: Li, Jingtao, et al.
Publicado: (2025)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
ArchGPT: Understanding the World's Architectures with Large Multimodal Models
por: Wang, Yuze, et al.
Publicado: (2025)
por: Wang, Yuze, et al.
Publicado: (2025)
Are Large-scale Soft Labels Necessary for Large-scale Dataset Distillation?
por: Xiao, Lingao, et al.
Publicado: (2024)
por: Xiao, Lingao, et al.
Publicado: (2024)
Fine-tune Smarter, Not Harder: Parameter-Efficient Fine-Tuning for Geospatial Foundation Models
por: Marti-Escofet, Francesc, et al.
Publicado: (2025)
por: Marti-Escofet, Francesc, et al.
Publicado: (2025)
Audio-Visual Intelligence in Large Foundation Models
por: Qin, You, et al.
Publicado: (2026)
por: Qin, You, et al.
Publicado: (2026)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
por: He, Jinlong, et al.
Publicado: (2024)
por: He, Jinlong, et al.
Publicado: (2024)
Less Could Be Better: Parameter-efficient Fine-tuning Advances Medical Vision Foundation Models
por: Lian, Chenyu, et al.
Publicado: (2024)
por: Lian, Chenyu, et al.
Publicado: (2024)
Multimodal Large Models Are Effective Action Anticipators
por: Wang, Binglu, et al.
Publicado: (2025)
por: Wang, Binglu, et al.
Publicado: (2025)
Multimodal Large Language Models for Medical Report Generation via Customized Prompt Tuning
por: Li, Chunlei, et al.
Publicado: (2025)
por: Li, Chunlei, et al.
Publicado: (2025)
What Color Is It? A Text-Interference Multimodal Hallucination Benchmark
por: Zhao, Jinkun, et al.
Publicado: (2025)
por: Zhao, Jinkun, et al.
Publicado: (2025)
Towards Foundation Models and Few-Shot Parameter-Efficient Fine-Tuning for Volumetric Organ Segmentation
por: Silva-Rodríguez, Julio, et al.
Publicado: (2023)
por: Silva-Rodríguez, Julio, et al.
Publicado: (2023)
Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning
por: Xu, Hai-Ming, et al.
Publicado: (2024)
por: Xu, Hai-Ming, et al.
Publicado: (2024)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
por: Wu, Wentao, et al.
Publicado: (2025)
por: Wu, Wentao, et al.
Publicado: (2025)
Dynamic Pyramid Network for Efficient Multimodal Large Language Model
por: Ai, Hao, et al.
Publicado: (2025)
por: Ai, Hao, et al.
Publicado: (2025)
End-to-End Vision Tokenizer Tuning
por: Wang, Wenxuan, et al.
Publicado: (2025)
por: Wang, Wenxuan, et al.
Publicado: (2025)
Mixed Text Recognition with Efficient Parameter Fine-Tuning and Transformer
por: Chang, Da, et al.
Publicado: (2024)
por: Chang, Da, et al.
Publicado: (2024)
Small but Mighty: Dynamic Wavelet Expert-Guided Fine-Tuning of Large-Scale Models for Optical Remote Sensing Object Segmentation
por: Sun, Yanguang, et al.
Publicado: (2026)
por: Sun, Yanguang, et al.
Publicado: (2026)
FisherTune: Fisher-Guided Robust Tuning of Vision Foundation Models for Domain Generalized Segmentation
por: Zhao, Dong, et al.
Publicado: (2025)
por: Zhao, Dong, et al.
Publicado: (2025)
Scaling Video Pretraining for Surgical Foundation Models
por: Lu, Sicheng, et al.
Publicado: (2026)
por: Lu, Sicheng, et al.
Publicado: (2026)
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
por: Jia, Hongrui, et al.
Publicado: (2024)
por: Jia, Hongrui, et al.
Publicado: (2024)
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
por: Zhang, Shilong, et al.
Publicado: (2023)
por: Zhang, Shilong, et al.
Publicado: (2023)
Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs
por: Wang, Ziqi, et al.
Publicado: (2025)
por: Wang, Ziqi, et al.
Publicado: (2025)
Ejemplares similares
-
LION: Implicit Vision Prompt Tuning
por: Wang, Haixin, et al.
Publicado: (2023) -
OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data
por: Zhang, Jinlu, et al.
Publicado: (2025) -
Visual Tuning
por: Yu, Bruce X. B., et al.
Publicado: (2023) -
Foundation Model for Endoscopy Video Analysis via Large-scale Self-supervised Pre-train
por: Wang, Zhao, et al.
Publicado: (2023) -
A Survey on Video Temporal Grounding with Multimodal Large Language Model
por: Wu, Jianlong, et al.
Publicado: (2025)