PanMatch: Unleashing the Potential of Large Vision Models for Unified Matching Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yongjian, Wang, Longguang, Li, Kunhong, Zhang, Ye, Wang, Yun, Lin, Liang, Guo, Yulan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Unified Hierarchical Framework for Fine-grained Cross-view Geo-localization over Large-scale Scenarios
di: Song, Zhuo, et al.
Pubblicazione: (2025)
di: Song, Zhuo, et al.
Pubblicazione: (2025)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
di: Wu, Haoning, et al.
Pubblicazione: (2023)
di: Wu, Haoning, et al.
Pubblicazione: (2023)
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
di: Xu, Yichen, et al.
Pubblicazione: (2025)
di: Xu, Yichen, et al.
Pubblicazione: (2025)
Flow Generator Matching
di: Huang, Zemin, et al.
Pubblicazione: (2024)
di: Huang, Zemin, et al.
Pubblicazione: (2024)
AToken: A Unified Tokenizer for Vision
di: Lu, Jiasen, et al.
Pubblicazione: (2025)
di: Lu, Jiasen, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
di: Wang, Xintong, et al.
Pubblicazione: (2024)
di: Wang, Xintong, et al.
Pubblicazione: (2024)
PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
di: Li, Qifei, et al.
Pubblicazione: (2024)
di: Li, Qifei, et al.
Pubblicazione: (2024)
Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective
di: Yuan, Hangjie, et al.
Pubblicazione: (2025)
di: Yuan, Hangjie, et al.
Pubblicazione: (2025)
A Light-weight Transformer-based Self-supervised Matching Network for Heterogeneous Images
di: Zhang, Wang, et al.
Pubblicazione: (2024)
di: Zhang, Wang, et al.
Pubblicazione: (2024)
A User-Friendly Framework for Generating Model-Preferred Prompts in Text-to-Image Synthesis
di: Hei, Nailei, et al.
Pubblicazione: (2024)
di: Hei, Nailei, et al.
Pubblicazione: (2024)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
di: Lin, Xiang, et al.
Pubblicazione: (2025)
di: Lin, Xiang, et al.
Pubblicazione: (2025)
Pre-training CLIP against Data Poisoning with Optimal Transport-based Matching and Alignment
di: Zhang, Tong, et al.
Pubblicazione: (2025)
di: Zhang, Tong, et al.
Pubblicazione: (2025)
Text-Only Data Synthesis for Vision Language Model Training
di: Yu, Xiaomin, et al.
Pubblicazione: (2025)
di: Yu, Xiaomin, et al.
Pubblicazione: (2025)
RacketVision: A Multiple Racket Sports Benchmark for Unified Ball and Racket Analysis
di: Dong, Linfeng, et al.
Pubblicazione: (2025)
di: Dong, Linfeng, et al.
Pubblicazione: (2025)
Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement
di: Lu, Renjie, et al.
Pubblicazione: (2026)
di: Lu, Renjie, et al.
Pubblicazione: (2026)
Mitigating Image Captioning Hallucinations in Vision-Language Models
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
AI-Driven Virtual Teacher for Enhanced Educational Efficiency: Leveraging Large Pretrain Models for Autonomous Error Analysis and Correction
di: Xu, Tianlong, et al.
Pubblicazione: (2024)
di: Xu, Tianlong, et al.
Pubblicazione: (2024)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer
di: Hu, Ying, et al.
Pubblicazione: (2024)
di: Hu, Ying, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
di: Chow, Wei, et al.
Pubblicazione: (2024)
di: Chow, Wei, et al.
Pubblicazione: (2024)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
di: Wang, Xiao, et al.
Pubblicazione: (2023)
di: Wang, Xiao, et al.
Pubblicazione: (2023)
Distilling Vision-Language Foundation Models: A Data-Free Approach via Prompt Diversification
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor
di: Zhao, Yan, et al.
Pubblicazione: (2025)
di: Zhao, Yan, et al.
Pubblicazione: (2025)
Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text Matching
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
LPM 1.0: Video-based Character Performance Model
di: Zeng, Ailing, et al.
Pubblicazione: (2026)
di: Zeng, Ailing, et al.
Pubblicazione: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
Cross Modification Attention Based Deliberation Model for Image Captioning
di: Lian, Zheng, et al.
Pubblicazione: (2021)
di: Lian, Zheng, et al.
Pubblicazione: (2021)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric
di: Lin, Haokun, et al.
Pubblicazione: (2024)
di: Lin, Haokun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Unified Hierarchical Framework for Fine-grained Cross-view Geo-localization over Large-scale Scenarios
di: Song, Zhuo, et al.
Pubblicazione: (2025) -
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
di: Wu, Haoning, et al.
Pubblicazione: (2023) -
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025) -
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
di: Xu, Yichen, et al.
Pubblicazione: (2025) -
Flow Generator Matching
di: Huang, Zemin, et al.
Pubblicazione: (2024)