KARST: Multi-Kernel Kronecker Adaptation with Re-Scaling Transmission for Visual Classification
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Yue, Diao, Haiwen, Gao, Shang, Chen, Long, Lu, Huchuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Regularizing Subspace Redundancy of Low-Rank Adaptation
von: Zhu, Yue, et al.
Veröffentlicht: (2025)
von: Zhu, Yue, et al.
Veröffentlicht: (2025)
GSSF: Generalized Structural Sparse Function for Deep Cross-modal Metric Learning
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text Matching
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
von: Yu, Jiazuo, et al.
Veröffentlicht: (2024)
von: Yu, Jiazuo, et al.
Veröffentlicht: (2024)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
RELO: Reinforcement Learning to Localize for Visual Object Tracking
von: Chen, Xin, et al.
Veröffentlicht: (2026)
von: Chen, Xin, et al.
Veröffentlicht: (2026)
ReHARK: Refined Hybrid Adaptive RBF Kernels for Robust One-Shot Vision-Language Adaptation
von: Islam, Md Jahidul
Veröffentlicht: (2026)
von: Islam, Md Jahidul
Veröffentlicht: (2026)
Referring Remote Sensing Image Segmentation with Cross-view Semantics Interaction Network
von: Yang, Jiaxing, et al.
Veröffentlicht: (2025)
von: Yang, Jiaxing, et al.
Veröffentlicht: (2025)
Multi-task Learning for Joint Re-identification, Team Affiliation, and Role Classification for Sports Visual Tracking
von: Mansourian, Amir M., et al.
Veröffentlicht: (2024)
von: Mansourian, Amir M., et al.
Veröffentlicht: (2024)
TCMM: Token Constraint and Multi-Scale Memory Bank of Contrastive Learning for Unsupervised Person Re-identification
von: Zhu, Zheng-An, et al.
Veröffentlicht: (2025)
von: Zhu, Zheng-An, et al.
Veröffentlicht: (2025)
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
von: Wang, Xinran, et al.
Veröffentlicht: (2024)
von: Wang, Xinran, et al.
Veröffentlicht: (2024)
UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
von: Diao, Haiwen, et al.
Veröffentlicht: (2023)
von: Diao, Haiwen, et al.
Veröffentlicht: (2023)
DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
von: Li, Xiaotong, et al.
Veröffentlicht: (2024)
von: Li, Xiaotong, et al.
Veröffentlicht: (2024)
EffOWT: Transfer Visual Language Models to Open-World Tracking Efficiently and Effectively
von: Wang, Bingyang, et al.
Veröffentlicht: (2025)
von: Wang, Bingyang, et al.
Veröffentlicht: (2025)
HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
von: Chen, Cong, et al.
Veröffentlicht: (2025)
von: Chen, Cong, et al.
Veröffentlicht: (2025)
Crowdsourcing of Real-world Image Annotation via Visual Properties
von: Diao, Xiaolei, et al.
Veröffentlicht: (2026)
von: Diao, Xiaolei, et al.
Veröffentlicht: (2026)
A Mutual Learning Method for Salient Object Detection with intertwined Multi-Supervision--Revised
von: Wu, Runmin, et al.
Veröffentlicht: (2025)
von: Wu, Runmin, et al.
Veröffentlicht: (2025)
VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?
von: Liu, Qing'an, et al.
Veröffentlicht: (2026)
von: Liu, Qing'an, et al.
Veröffentlicht: (2026)
GarmentPile: Point-Level Visual Affordance Guided Retrieval and Adaptation for Cluttered Garments Manipulation
von: Wu, Ruihai, et al.
Veröffentlicht: (2025)
von: Wu, Ruihai, et al.
Veröffentlicht: (2025)
Scaling Up Your Kernels: Large Kernel Design in ConvNets towards Universal Representations
von: Zhang, Yiyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Yiyuan, et al.
Veröffentlicht: (2024)
Multi-Scale Correlation-Aware Transformer for Maritime Vessel Re-Identification
von: Liu, Yunhe
Veröffentlicht: (2025)
von: Liu, Yunhe
Veröffentlicht: (2025)
Advancing Efficient Brain Tumor Multi-Class Classification -- New Insights from the Vision Mamba Model in Transfer Learning
von: Lai, Yinyi, et al.
Veröffentlicht: (2024)
von: Lai, Yinyi, et al.
Veröffentlicht: (2024)
ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs
von: Fang, Rui, et al.
Veröffentlicht: (2026)
von: Fang, Rui, et al.
Veröffentlicht: (2026)
ReStNet: A Reusable & Stitchable Network for Dynamic Adaptation on IoT Devices
von: Wang, Maoyu, et al.
Veröffentlicht: (2025)
von: Wang, Maoyu, et al.
Veröffentlicht: (2025)
SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning
von: Yao, Zhengjian, et al.
Veröffentlicht: (2026)
von: Yao, Zhengjian, et al.
Veröffentlicht: (2026)
H3Former: Hypergraph-based Semantic-Aware Aggregation via Hyperbolic Hierarchical Contrastive Loss for Fine-Grained Visual Classification
von: Zhang, Yongji, et al.
Veröffentlicht: (2025)
von: Zhang, Yongji, et al.
Veröffentlicht: (2025)
The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
DCG ReID: Disentangling Collaboration and Guidance Fusion Representations for Multi-modal Vehicle Re-Identification
von: Zheng, Aihua, et al.
Veröffentlicht: (2026)
von: Zheng, Aihua, et al.
Veröffentlicht: (2026)
H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving
von: Chen, Siran, et al.
Veröffentlicht: (2025)
von: Chen, Siran, et al.
Veröffentlicht: (2025)
MSLoRA: Multi-Scale Low-Rank Adaptation via Attention Reweighting
von: Yang, Xu, et al.
Veröffentlicht: (2025)
von: Yang, Xu, et al.
Veröffentlicht: (2025)
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
Towards Seamless Adaptation of Pre-trained Models for Visual Place Recognition
von: Lu, Feng, et al.
Veröffentlicht: (2024)
von: Lu, Feng, et al.
Veröffentlicht: (2024)
AIDA-ReID: Adaptive Intermediate Domain Adaptation for Generalizable and Source-Free Person Re-Identification
von: Iqbal, Sundas, et al.
Veröffentlicht: (2026)
von: Iqbal, Sundas, et al.
Veröffentlicht: (2026)
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
von: Yu, Xinlei, et al.
Veröffentlicht: (2025)
von: Yu, Xinlei, et al.
Veröffentlicht: (2025)
MMLNB: Multi-Modal Learning for Neuroblastoma Subtyping Classification Assisted with Textual Description Generation
von: Chen, Huangwei, et al.
Veröffentlicht: (2025)
von: Chen, Huangwei, et al.
Veröffentlicht: (2025)
MKSNet: Advanced Small Object Detection in Remote Sensing Imagery with Multi-Kernel and Dual Attention Mechanisms
von: Zhang, Jiahao, et al.
Veröffentlicht: (2025)
von: Zhang, Jiahao, et al.
Veröffentlicht: (2025)
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
von: Guo, Guangfu, et al.
Veröffentlicht: (2026)
von: Guo, Guangfu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Regularizing Subspace Redundancy of Low-Rank Adaptation
von: Zhu, Yue, et al.
Veröffentlicht: (2025) -
GSSF: Generalized Structural Sparse Function for Deep Cross-modal Metric Learning
von: Diao, Haiwen, et al.
Veröffentlicht: (2024) -
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
von: Diao, Haiwen, et al.
Veröffentlicht: (2025) -
Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text Matching
von: Diao, Haiwen, et al.
Veröffentlicht: (2024) -
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
von: Yu, Jiazuo, et al.
Veröffentlicht: (2024)