StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues
Fuente:
arXiv
Salvato in:
| Autori principali: | Ruan, Zanxi, Gao, Songqun, Kong, Qiuyu, Wang, Yiming, Cristani, Marco |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Is SAM3 ready for pathology segmentation?
di: Kong, Qiuyu, et al.
Pubblicazione: (2026)
di: Kong, Qiuyu, et al.
Pubblicazione: (2026)
LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
di: Girella, Federico, et al.
Pubblicazione: (2025)
di: Girella, Federico, et al.
Pubblicazione: (2025)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
di: Talon, Davide, et al.
Pubblicazione: (2025)
di: Talon, Davide, et al.
Pubblicazione: (2025)
Image2Struct: Benchmarking Structure Extraction for Vision-Language Models
di: Roberts, Josselin Somerville, et al.
Pubblicazione: (2024)
di: Roberts, Josselin Somerville, et al.
Pubblicazione: (2024)
Latent Space Synergy: Text-Guided Data Augmentation for Direct Diffusion Biomedical Segmentation
di: Aqeel, Muhammad, et al.
Pubblicazione: (2025)
di: Aqeel, Muhammad, et al.
Pubblicazione: (2025)
BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users
di: Cheng, Wanyin, et al.
Pubblicazione: (2025)
di: Cheng, Wanyin, et al.
Pubblicazione: (2025)
LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks
di: Liu, Hui, et al.
Pubblicazione: (2025)
di: Liu, Hui, et al.
Pubblicazione: (2025)
Multi-Level Conditioning by Pairing Localized Text and Sketch for Fashion Image Generation
di: Liu, Ziyue, et al.
Pubblicazione: (2026)
di: Liu, Ziyue, et al.
Pubblicazione: (2026)
Benchmarking Interaction, Beyond Policy: a Reproducible Benchmark for Collaborative Instance Object Navigation
di: Zorzi, Edoardo, et al.
Pubblicazione: (2026)
di: Zorzi, Edoardo, et al.
Pubblicazione: (2026)
Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection
di: Aqeel, Muhammad, et al.
Pubblicazione: (2026)
di: Aqeel, Muhammad, et al.
Pubblicazione: (2026)
Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout
di: QI, Anbin, et al.
Pubblicazione: (2024)
di: QI, Anbin, et al.
Pubblicazione: (2024)
Vision-Enhanced Time Series Forecasting via Latent Diffusion Models
di: Ruan, Weilin, et al.
Pubblicazione: (2025)
di: Ruan, Weilin, et al.
Pubblicazione: (2025)
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
Assessing Color Vision Test in Large Vision-language Models
di: Ye, Hongfei, et al.
Pubblicazione: (2025)
di: Ye, Hongfei, et al.
Pubblicazione: (2025)
SmartCLIP: Modular Vision-language Alignment with Identification Guarantees
di: Xie, Shaoan, et al.
Pubblicazione: (2025)
di: Xie, Shaoan, et al.
Pubblicazione: (2025)
SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion
di: Wu, Wenfang, et al.
Pubblicazione: (2025)
di: Wu, Wenfang, et al.
Pubblicazione: (2025)
From Local Cues to Global Percepts: Emergent Gestalt Organization in Self-Supervised Vision Models
di: Li, Tianqin, et al.
Pubblicazione: (2025)
di: Li, Tianqin, et al.
Pubblicazione: (2025)
Uncovering Grounding IDs: How External Cues Shape Multimodal Binding
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
di: Shen, Boyang, et al.
Pubblicazione: (2026)
di: Shen, Boyang, et al.
Pubblicazione: (2026)
IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models
di: Chen, Zhihao, et al.
Pubblicazione: (2023)
di: Chen, Zhihao, et al.
Pubblicazione: (2023)
Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning
di: Liu, Junming, et al.
Pubblicazione: (2025)
di: Liu, Junming, et al.
Pubblicazione: (2025)
GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models
di: Liao, Haicheng, et al.
Pubblicazione: (2023)
di: Liao, Haicheng, et al.
Pubblicazione: (2023)
Learning to Solve Orienteering Problem with Time Windows and Variable Profits
di: Gao, Songqun, et al.
Pubblicazione: (2026)
di: Gao, Songqun, et al.
Pubblicazione: (2026)
VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation
di: Taioli, Francesco, et al.
Pubblicazione: (2026)
di: Taioli, Francesco, et al.
Pubblicazione: (2026)
When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models
di: Saini, Harshvardhan, et al.
Pubblicazione: (2026)
di: Saini, Harshvardhan, et al.
Pubblicazione: (2026)
Evaluating Large Vision-language Models for Surgical Tool Detection
di: Poudel, Nakul, et al.
Pubblicazione: (2026)
di: Poudel, Nakul, et al.
Pubblicazione: (2026)
EfficientFSL: Enhancing Few-Shot Classification via Query-Only Tuning in Vision Transformers
di: Liao, Wenwen, et al.
Pubblicazione: (2026)
di: Liao, Wenwen, et al.
Pubblicazione: (2026)
Training-Free Unsupervised Prompt for Vision-Language Models
di: Long, Sifan, et al.
Pubblicazione: (2024)
di: Long, Sifan, et al.
Pubblicazione: (2024)
ClearSight: Visual Signal Enhancement for Object Hallucination Mitigation in Multimodal Large language Models
di: Yin, Hao, et al.
Pubblicazione: (2025)
di: Yin, Hao, et al.
Pubblicazione: (2025)
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
di: Liu, Hanpeng, et al.
Pubblicazione: (2026)
di: Liu, Hanpeng, et al.
Pubblicazione: (2026)
Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
di: Chen, Zhanpeng, et al.
Pubblicazione: (2025)
di: Chen, Zhanpeng, et al.
Pubblicazione: (2025)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice
di: Meng, Zijie, et al.
Pubblicazione: (2025)
di: Meng, Zijie, et al.
Pubblicazione: (2025)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
A Multimodal Vision Foundation Model for Clinical Dermatology
di: Yan, Siyuan, et al.
Pubblicazione: (2024)
di: Yan, Siyuan, et al.
Pubblicazione: (2024)
StructGS: Adaptive Spherical Harmonics and Rendering Enhancements for Superior 3D Gaussian Splatting
di: Huang, Zexu, et al.
Pubblicazione: (2025)
di: Huang, Zexu, et al.
Pubblicazione: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
Power of Boundary and Reflection: Semantic Transparent Object Segmentation using Pyramid Vision Transformer with Transparent Cues
di: Vu, Tuan-Anh, et al.
Pubblicazione: (2025)
di: Vu, Tuan-Anh, et al.
Pubblicazione: (2025)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
di: Wang, Yizhou, et al.
Pubblicazione: (2025)
di: Wang, Yizhou, et al.
Pubblicazione: (2025)
Efficient Encoder-Free Fourier-based 3D Large Multimodal Model
di: Mei, Guofeng, et al.
Pubblicazione: (2026)
di: Mei, Guofeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Is SAM3 ready for pathology segmentation?
di: Kong, Qiuyu, et al.
Pubblicazione: (2026) -
LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
di: Girella, Federico, et al.
Pubblicazione: (2025) -
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
di: Talon, Davide, et al.
Pubblicazione: (2025) -
Image2Struct: Benchmarking Structure Extraction for Vision-Language Models
di: Roberts, Josselin Somerville, et al.
Pubblicazione: (2024) -
Latent Space Synergy: Text-Guided Data Augmentation for Direct Diffusion Biomedical Segmentation
di: Aqeel, Muhammad, et al.
Pubblicazione: (2025)