DLM-VMTL:A Double Layer Mapper for heterogeneous data video Multi-task prompt learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bo, Zeyi, Sun, Wuxi, Jin, Ye |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation
par: Ke, Shuyan, et autres
Publié: (2026)
par: Ke, Shuyan, et autres
Publié: (2026)
Contrastive learning-based video quality assessment-jointed video vision transformer for video recognition
par: Sun, Jian, et autres
Publié: (2026)
par: Sun, Jian, et autres
Publié: (2026)
BridgeNet: Comprehensive and Effective Feature Interactions via Bridge Feature for Multi-task Dense Predictions
par: Zhang, Jingdong, et autres
Publié: (2023)
par: Zhang, Jingdong, et autres
Publié: (2023)
ColonMapper: topological mapping and localization for colonoscopy
par: Morlana, Javier, et autres
Publié: (2023)
par: Morlana, Javier, et autres
Publié: (2023)
Learning reusable concepts across different egocentric video understanding tasks
par: Peirone, Simone Alberto, et autres
Publié: (2025)
par: Peirone, Simone Alberto, et autres
Publié: (2025)
Efficient RGB-D Scene Understanding via Multi-task Adaptive Learning and Cross-dimensional Feature Guidance
par: Sun, Guodong, et autres
Publié: (2026)
par: Sun, Guodong, et autres
Publié: (2026)
bi-modal textual prompt learning for vision-language models in remote sensing
par: Kashyap, Pankhi, et autres
Publié: (2026)
par: Kashyap, Pankhi, et autres
Publié: (2026)
Multi-model learning by sequential reading of untrimmed videos for action recognition
par: Kamiya, Kodai, et autres
Publié: (2024)
par: Kamiya, Kodai, et autres
Publié: (2024)
Multi-step manipulation task and motion planning guided by video demonstration
par: Zorina, Kateryna, et autres
Publié: (2025)
par: Zorina, Kateryna, et autres
Publié: (2025)
MECFormer: Multi-task Whole Slide Image Classification with Expert Consultation Network
par: Bui, Doanh C., et autres
Publié: (2024)
par: Bui, Doanh C., et autres
Publié: (2024)
MT-Depth: Multi-task Instance feature analysis for the Depth Completion
par: Nizamani, Abdul Haseeb, et autres
Publié: (2025)
par: Nizamani, Abdul Haseeb, et autres
Publié: (2025)
Noise-aware few-shot learning through bi-directional multi-view prompt alignment
par: Niu, Lu, et autres
Publié: (2026)
par: Niu, Lu, et autres
Publié: (2026)
Giving each task what it needs -- leveraging structured sparsity for tailored multi-task learning
par: Upadhyay, Richa, et autres
Publié: (2024)
par: Upadhyay, Richa, et autres
Publié: (2024)
Multi-modal video data-pipelines for machine learning with minimal human supervision
par: Pîrvu, Mihai-Cristian, et autres
Publié: (2025)
par: Pîrvu, Mihai-Cristian, et autres
Publié: (2025)
Data-free Distillation with Degradation-prompt Diffusion for Multi-weather Image Restoration
par: Wang, Pei, et autres
Publié: (2024)
par: Wang, Pei, et autres
Publié: (2024)
Synthetic data shuffling accelerates the convergence of federated learning under data heterogeneity
par: Li, Bo, et autres
Publié: (2023)
par: Li, Bo, et autres
Publié: (2023)
UniPINN: A Unified PINN Framework for Multi-task Learning of Diverse Navier-Stokes Equations
par: Sun, Dengdi, et autres
Publié: (2026)
par: Sun, Dengdi, et autres
Publié: (2026)
LiDARFormer: A Unified Transformer-based Multi-task Network for LiDAR Perception
par: Zhou, Zixiang, et autres
Publié: (2023)
par: Zhou, Zixiang, et autres
Publié: (2023)
iOSPointMapper: RealTime Pedestrian and Accessibility Mapping with Mobile AI
par: Naidu, Himanshu, et autres
Publié: (2025)
par: Naidu, Himanshu, et autres
Publié: (2025)
MultiTaskVIF: Segmentation-oriented visible and infrared image fusion via multi-task learning
par: Zhao, Zixian, et autres
Publié: (2025)
par: Zhao, Zixian, et autres
Publié: (2025)
EarthMapper: Visual Autoregressive Models for Controllable Bidirectional Satellite-Map Translation
par: Dong, Zhe, et autres
Publié: (2025)
par: Dong, Zhe, et autres
Publié: (2025)
OTSeg: Multi-prompt Sinkhorn Attention for Zero-Shot Semantic Segmentation
par: Kim, Kwanyoung, et autres
Publié: (2024)
par: Kim, Kwanyoung, et autres
Publié: (2024)
Deep video representation learning: a survey
par: Ravanbakhsh, Elham, et autres
Publié: (2024)
par: Ravanbakhsh, Elham, et autres
Publié: (2024)
PrePrompt: Predictive prompting for class incremental learning
par: Huang, Libo, et autres
Publié: (2025)
par: Huang, Libo, et autres
Publié: (2025)
MVQA-68K: A Multi-dimensional and Causally-annotated Dataset with Quality Interpretability for Video Assessment
par: Pu, Yanyun, et autres
Publié: (2025)
par: Pu, Yanyun, et autres
Publié: (2025)
IC-Mapper: Instance-Centric Spatio-Temporal Modeling for Online Vectorized Map Construction
par: Zhu, Jiangtong, et autres
Publié: (2025)
par: Zhu, Jiangtong, et autres
Publié: (2025)
On the test-time zero-shot generalization of vision-language models: Do we really need prompt learning?
par: Zanella, Maxime, et autres
Publié: (2024)
par: Zanella, Maxime, et autres
Publié: (2024)
MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection
par: Zhao, Xiran, et autres
Publié: (2026)
par: Zhao, Xiran, et autres
Publié: (2026)
MUSE: Mamba is Efficient Multi-scale Learner for Text-video Retrieval
par: Tang, Haoran, et autres
Publié: (2024)
par: Tang, Haoran, et autres
Publié: (2024)
InsMapper: Exploring Inner-instance Information for Vectorized HD Mapping
par: Xu, Zhenhua, et autres
Publié: (2023)
par: Xu, Zhenhua, et autres
Publié: (2023)
Vanish into Thin Air: Cross-prompt Universal Adversarial Attacks for SAM2
par: Zhou, Ziqi, et autres
Publié: (2025)
par: Zhou, Ziqi, et autres
Publié: (2025)
Deep learning for action spotting in association football videos
par: Giancola, Silvio, et autres
Publié: (2024)
par: Giancola, Silvio, et autres
Publié: (2024)
GPT4Point: A Unified Framework for Point-Language Understanding and Generation
par: Qi, Zhangyang, et autres
Publié: (2023)
par: Qi, Zhangyang, et autres
Publié: (2023)
Body Segmentation Using Multi-task Learning
par: Jug, Julijan, et autres
Publié: (2022)
par: Jug, Julijan, et autres
Publié: (2022)
A multi-center analysis of deep learning methods for video polyp detection and segmentation
par: Ghatwary, Noha, et autres
Publié: (2026)
par: Ghatwary, Noha, et autres
Publié: (2026)
LifelongPR: Lifelong point cloud place recognition based on sample replay and prompt learning
par: Zou, Xianghong, et autres
Publié: (2025)
par: Zou, Xianghong, et autres
Publié: (2025)
Forgetting of task-specific knowledge in model merging-based continual learning
par: Hess, Timm, et autres
Publié: (2025)
par: Hess, Timm, et autres
Publié: (2025)
How good are deep learning methods for automated road safety analysis using video data? An experimental study
par: Liu, Qingwu, et autres
Publié: (2025)
par: Liu, Qingwu, et autres
Publié: (2025)
MMHMER:Multi-viewer and Multi-task for Handwritten Mathematical Expression Recognition
par: Chen, Kehua, et autres
Publié: (2025)
par: Chen, Kehua, et autres
Publié: (2025)
MultiMatch: Multi-task Learning for Semi-supervised Domain Generalization
par: Qi, Lei, et autres
Publié: (2022)
par: Qi, Lei, et autres
Publié: (2022)
Documents similaires
-
PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation
par: Ke, Shuyan, et autres
Publié: (2026) -
Contrastive learning-based video quality assessment-jointed video vision transformer for video recognition
par: Sun, Jian, et autres
Publié: (2026) -
BridgeNet: Comprehensive and Effective Feature Interactions via Bridge Feature for Multi-task Dense Predictions
par: Zhang, Jingdong, et autres
Publié: (2023) -
ColonMapper: topological mapping and localization for colonoscopy
par: Morlana, Javier, et autres
Publié: (2023) -
Learning reusable concepts across different egocentric video understanding tasks
par: Peirone, Simone Alberto, et autres
Publié: (2025)