3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting
Fuente:
arXiv
Salvato in:
| Autori principali: | Ge, Xuri, Xu, Songpei, Chen, Fuhai, Wang, Jie, Wang, Guoxin, An, Shan, Jose, Joemon M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching
di: Ge, Xuri, et al.
Pubblicazione: (2024)
di: Ge, Xuri, et al.
Pubblicazione: (2024)
MGRR-Net: Multi-level Graph Relational Reasoning Network for Facial Action Units Detection
di: Ge, Xuri, et al.
Pubblicazione: (2022)
di: Ge, Xuri, et al.
Pubblicazione: (2022)
Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning
di: Ge, Xuri, et al.
Pubblicazione: (2024)
di: Ge, Xuri, et al.
Pubblicazione: (2024)
CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora
di: Long, Zijun, et al.
Pubblicazione: (2024)
di: Long, Zijun, et al.
Pubblicazione: (2024)
Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
Detail-Enhanced Intra- and Inter-modal Interaction for Audio-Visual Emotion Recognition
di: Shi, Tong, et al.
Pubblicazione: (2024)
di: Shi, Tong, et al.
Pubblicazione: (2024)
HpEIS: Learning Hand Pose Embeddings for Multimedia Interactive Systems
di: Xu, Songpei, et al.
Pubblicazione: (2024)
di: Xu, Songpei, et al.
Pubblicazione: (2024)
Multimodal Representation Learning Techniques for Comprehensive Facial State Analysis
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
IISAN: Efficiently Adapting Multimodal Representation for Sequential Recommendation with Decoupled PEFT
di: Fu, Junchen, et al.
Pubblicazione: (2024)
di: Fu, Junchen, et al.
Pubblicazione: (2024)
MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval
di: Ge, Xuri, et al.
Pubblicazione: (2026)
di: Ge, Xuri, et al.
Pubblicazione: (2026)
Hierarchical Dual-Change Collaborative Learning for UAV Scene Change Captioning
di: Chen, Fuhai, et al.
Pubblicazione: (2026)
di: Chen, Fuhai, et al.
Pubblicazione: (2026)
Efficient and Effective Adaptation of Multimodal Foundation Models in Sequential Recommendation
di: Fu, Junchen, et al.
Pubblicazione: (2024)
di: Fu, Junchen, et al.
Pubblicazione: (2024)
LLMPopcorn: Exploring LLMs as Assistants for Popular Micro-video Generation
di: Fu, Junchen, et al.
Pubblicazione: (2025)
di: Fu, Junchen, et al.
Pubblicazione: (2025)
Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues
di: Fu, Junchen, et al.
Pubblicazione: (2026)
di: Fu, Junchen, et al.
Pubblicazione: (2026)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
di: Guo, Jiajie, et al.
Pubblicazione: (2025)
di: Guo, Jiajie, et al.
Pubblicazione: (2025)
Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval
di: Du, Yongchao, et al.
Pubblicazione: (2024)
di: Du, Yongchao, et al.
Pubblicazione: (2024)
Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation
di: Zhang, Yabo, et al.
Pubblicazione: (2026)
di: Zhang, Yabo, et al.
Pubblicazione: (2026)
EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy
di: Ge, Xuanyu, et al.
Pubblicazione: (2026)
di: Ge, Xuanyu, et al.
Pubblicazione: (2026)
Boosting Temporal Sentence Grounding via Causal Inference
di: Tang, Kefan, et al.
Pubblicazione: (2025)
di: Tang, Kefan, et al.
Pubblicazione: (2025)
MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning
di: Ma, Hongxu, et al.
Pubblicazione: (2025)
di: Ma, Hongxu, et al.
Pubblicazione: (2025)
Image to Pseudo-Episode: Boosting Few-Shot Segmentation by Unlabeled Data
di: Zhang, Jie, et al.
Pubblicazione: (2024)
di: Zhang, Jie, et al.
Pubblicazione: (2024)
Boosting HDR Image Reconstruction via Semantic Knowledge Transfer
di: Hu, Tao, et al.
Pubblicazione: (2025)
di: Hu, Tao, et al.
Pubblicazione: (2025)
Information-Maximized Soft Variable Discretization for Self-Supervised Image Representation Learning
di: Niu, Chuang, et al.
Pubblicazione: (2025)
di: Niu, Chuang, et al.
Pubblicazione: (2025)
Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation
di: Li, Zhiyuan, et al.
Pubblicazione: (2023)
di: Li, Zhiyuan, et al.
Pubblicazione: (2023)
Large Spatial Model: End-to-end Unposed Images to Semantic 3D
di: Fan, Zhiwen, et al.
Pubblicazione: (2024)
di: Fan, Zhiwen, et al.
Pubblicazione: (2024)
CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection
di: Dong, Xin, et al.
Pubblicazione: (2026)
di: Dong, Xin, et al.
Pubblicazione: (2026)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
di: Xu, Beining, et al.
Pubblicazione: (2025)
di: Xu, Beining, et al.
Pubblicazione: (2025)
A Bi-Pyramid Multimodal Fusion Method for the Diagnosis of Bipolar Disorders
di: Wang, Guoxin, et al.
Pubblicazione: (2024)
di: Wang, Guoxin, et al.
Pubblicazione: (2024)
Learning Visual Hierarchies in Hyperbolic Space for Image Retrieval
di: Wang, Ziwei, et al.
Pubblicazione: (2024)
di: Wang, Ziwei, et al.
Pubblicazione: (2024)
GaussianImage++: Boosted Image Representation and Compression with 2D Gaussian Splatting
di: Li, Tiantian, et al.
Pubblicazione: (2025)
di: Li, Tiantian, et al.
Pubblicazione: (2025)
A Highlight Removal Method for Capsule Endoscopy Images
di: Zhang, Shaojie, et al.
Pubblicazione: (2024)
di: Zhang, Shaojie, et al.
Pubblicazione: (2024)
M3Ret: Unleashing Zero-shot Multimodal Medical Image Retrieval via Self-Supervision
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels
di: Jiang, Yingying, et al.
Pubblicazione: (2024)
di: Jiang, Yingying, et al.
Pubblicazione: (2024)
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
Visual Foundation Models Boost Cross-Modal Unsupervised Domain Adaptation for 3D Semantic Segmentation
di: Xu, Jingyi, et al.
Pubblicazione: (2024)
di: Xu, Jingyi, et al.
Pubblicazione: (2024)
Towards Robust Semantic Segmentation against Patch-based Attack via Attention Refinement
di: Yuan, Zheng, et al.
Pubblicazione: (2024)
di: Yuan, Zheng, et al.
Pubblicazione: (2024)
SSD: Spatial-Semantic Head Decoupling for Efficient Autoregressive Image Generation
di: Jian, Siyong, et al.
Pubblicazione: (2025)
di: Jian, Siyong, et al.
Pubblicazione: (2025)
ShotVL: Human-Centric Highlight Frame Retrieval via Language Queries
di: Xue, Wangyu, et al.
Pubblicazione: (2024)
di: Xue, Wangyu, et al.
Pubblicazione: (2024)
GPTSee: Enhancing Moment Retrieval and Highlight Detection via Description-Based Similarity Features
di: Sun, Yunzhuo, et al.
Pubblicazione: (2024)
di: Sun, Yunzhuo, et al.
Pubblicazione: (2024)
TextBoost: Boosting Scene Text Fidelity in Ultra-low Bitrate Image Compression
di: Wang, Bingxin, et al.
Pubblicazione: (2026)
di: Wang, Bingxin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching
di: Ge, Xuri, et al.
Pubblicazione: (2024) -
MGRR-Net: Multi-level Graph Relational Reasoning Network for Facial Action Units Detection
di: Ge, Xuri, et al.
Pubblicazione: (2022) -
Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning
di: Ge, Xuri, et al.
Pubblicazione: (2024) -
CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora
di: Long, Zijun, et al.
Pubblicazione: (2024) -
Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)