Joint Fusion and Encoding: Advancing Multimodal Retrieval from the Ground Up
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Lang, Wu, Qiyu, Miao, Zhongtao, Yamasaki, Toshihiko |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CE-FAM: Concept-Based Explanation via Fusion of Activation Maps
di: Kuroki, Michihiro, et al.
Pubblicazione: (2025)
di: Kuroki, Michihiro, et al.
Pubblicazione: (2025)
A Multihead Continual Learning Framework for Fine-Grained Fashion Image Retrieval with Contrastive Learning and Exponential Moving Average Distillation
di: Xiao, Ling, et al.
Pubblicazione: (2026)
di: Xiao, Ling, et al.
Pubblicazione: (2026)
Mirai: Autoregressive Visual Generation Needs Foresight
di: Yu, Yonghao, et al.
Pubblicazione: (2026)
di: Yu, Yonghao, et al.
Pubblicazione: (2026)
Bias Beyond Demographics: Probing Decision Boundaries in Black-Box LVLMs via Counterfactual VQA
di: Zhao, Zaiying, et al.
Pubblicazione: (2025)
di: Zhao, Zaiying, et al.
Pubblicazione: (2025)
Unified Vector Floorplan Generation via Markup Representation
di: Shiohara, Kaede, et al.
Pubblicazione: (2026)
di: Shiohara, Kaede, et al.
Pubblicazione: (2026)
BSED: Baseline Shapley-Based Explainable Detector
di: Kuroki, Michihiro, et al.
Pubblicazione: (2023)
di: Kuroki, Michihiro, et al.
Pubblicazione: (2023)
Face2Diffusion for Fast and Editable Face Personalization
di: Shiohara, Kaede, et al.
Pubblicazione: (2024)
di: Shiohara, Kaede, et al.
Pubblicazione: (2024)
Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation
di: Tanji, Naoto, et al.
Pubblicazione: (2025)
di: Tanji, Naoto, et al.
Pubblicazione: (2025)
Attribute-Guided Multi-Level Attention Network for Fine-Grained Fashion Retrieval
di: Xiao, Ling, et al.
Pubblicazione: (2022)
di: Xiao, Ling, et al.
Pubblicazione: (2022)
SCOMatch: Alleviating Overtrusting in Open-set Semi-supervised Learning
di: Wang, Zerun, et al.
Pubblicazione: (2024)
di: Wang, Zerun, et al.
Pubblicazione: (2024)
ControlVP: Interactive Geometric Refinement of AI-Generated Images with Consistent Vanishing Points
di: Okumura, Ryota, et al.
Pubblicazione: (2025)
di: Okumura, Ryota, et al.
Pubblicazione: (2025)
ExposeAnyone: Personalized Audio-to-Expression Diffusion Models Are Robust Zero-Shot Face Forgery Detectors
di: Shiohara, Kaede, et al.
Pubblicazione: (2026)
di: Shiohara, Kaede, et al.
Pubblicazione: (2026)
Language-guided Detection and Mitigation of Unknown Dataset Bias
di: Zhao, Zaiying, et al.
Pubblicazione: (2024)
di: Zhao, Zaiying, et al.
Pubblicazione: (2024)
Adversarial Training from Mean Field Perspective
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
Theoretical Understanding of Learning from Adversarial Perturbations
di: Kumano, Soichiro, et al.
Pubblicazione: (2024)
di: Kumano, Soichiro, et al.
Pubblicazione: (2024)
Wide Two-Layer Networks can Learn from Adversarial Perturbations
di: Kumano, Soichiro, et al.
Pubblicazione: (2024)
di: Kumano, Soichiro, et al.
Pubblicazione: (2024)
Difficulty Controlled Diffusion Model for Synthesizing Effective Training Data
di: Wang, Zerun, et al.
Pubblicazione: (2024)
di: Wang, Zerun, et al.
Pubblicazione: (2024)
From Obstacles to Resources: Semi-supervised Learning Faces Synthetic Data Contamination
di: Wang, Zerun, et al.
Pubblicazione: (2024)
di: Wang, Zerun, et al.
Pubblicazione: (2024)
Language-Guided Self-Supervised Video Summarization Using Text Semantic Matching Considering the Diversity of the Video
di: Sugihara, Tomoya, et al.
Pubblicazione: (2024)
di: Sugihara, Tomoya, et al.
Pubblicazione: (2024)
Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
Auto-Comp: An Automated Pipeline for Scalable Compositional Probing of Contrastive Vision-Language Models
di: Sbrolli, Cristian, et al.
Pubblicazione: (2026)
di: Sbrolli, Cristian, et al.
Pubblicazione: (2026)
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
di: Ma, Longhui, et al.
Pubblicazione: (2026)
di: Ma, Longhui, et al.
Pubblicazione: (2026)
Continual Distillation of Teachers from Different Domains
di: Michel, Nicolas, et al.
Pubblicazione: (2026)
di: Michel, Nicolas, et al.
Pubblicazione: (2026)
Joint Top-Down and Bottom-Up Frameworks for 3D Visual Grounding
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Probing Multimodal Fusion in the Brain: The Dominance of Audiovisual Streams in Naturalistic Encoding
di: Abdollahi, Hamid, et al.
Pubblicazione: (2025)
di: Abdollahi, Hamid, et al.
Pubblicazione: (2025)
Online Open-set Semi-supervised Object Detection with Dual Competing Head
di: Wang, Zerun, et al.
Pubblicazione: (2023)
di: Wang, Zerun, et al.
Pubblicazione: (2023)
Spectral Probing of Feature Upsamplers in 2D-to-3D Scene Reconstruction
di: Xiao, Ling, et al.
Pubblicazione: (2026)
di: Xiao, Ling, et al.
Pubblicazione: (2026)
StrokeFusion: Vector Sketch Generation via Joint Stroke-UDF Encoding and Latent Sequence Diffusion
di: Zhou, Jin, et al.
Pubblicazione: (2025)
di: Zhou, Jin, et al.
Pubblicazione: (2025)
Reward Incremental Learning in Text-to-Image Generation
di: Wang, Maorong, et al.
Pubblicazione: (2024)
di: Wang, Maorong, et al.
Pubblicazione: (2024)
Dealing with Synthetic Data Contamination in Online Continual Learning
di: Wang, Maorong, et al.
Pubblicazione: (2024)
di: Wang, Maorong, et al.
Pubblicazione: (2024)
SOLAR: Self-supervised Joint Learning for Symmetric Multimodal Retrieval
di: Yang, Wenjie, et al.
Pubblicazione: (2026)
di: Yang, Wenjie, et al.
Pubblicazione: (2026)
Dual-task Mutual Reinforcing Embedded Joint Video Paragraph Retrieval and Grounding
di: Wang, Mengzhao, et al.
Pubblicazione: (2024)
di: Wang, Mengzhao, et al.
Pubblicazione: (2024)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
Robust Deepfake Detection for Electronic Know Your Customer Systems Using Registered Images
di: Amada, Takuma, et al.
Pubblicazione: (2025)
di: Amada, Takuma, et al.
Pubblicazione: (2025)
A Benchmark and Knowledge-Grounded Framework for Advanced Multimodal Personalization Study
di: Hu, Xia, et al.
Pubblicazione: (2026)
di: Hu, Xia, et al.
Pubblicazione: (2026)
A Multimodal RAG Framework for Housing Damage Assessment: Collaborative Optimization of Image Encoding and Policy Vector Retrieval
di: Miao, Jiayi, et al.
Pubblicazione: (2025)
di: Miao, Jiayi, et al.
Pubblicazione: (2025)
HyPCA-Net: Advancing Multimodal Fusion in Medical Image Analysis
di: Dhar, J., et al.
Pubblicazione: (2026)
di: Dhar, J., et al.
Pubblicazione: (2026)
Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation
di: Li, Haocheng, et al.
Pubblicazione: (2026)
di: Li, Haocheng, et al.
Pubblicazione: (2026)
Data-Driven Prediction of Seismic Intensity Distributions Featuring Hybrid Classification-Regression Models
di: Mizutani, Koyu, et al.
Pubblicazione: (2024)
di: Mizutani, Koyu, et al.
Pubblicazione: (2024)
Revisiting Multimodal Positional Encoding in Vision-Language Models
di: Huang, Jie, et al.
Pubblicazione: (2025)
di: Huang, Jie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CE-FAM: Concept-Based Explanation via Fusion of Activation Maps
di: Kuroki, Michihiro, et al.
Pubblicazione: (2025) -
A Multihead Continual Learning Framework for Fine-Grained Fashion Image Retrieval with Contrastive Learning and Exponential Moving Average Distillation
di: Xiao, Ling, et al.
Pubblicazione: (2026) -
Mirai: Autoregressive Visual Generation Needs Foresight
di: Yu, Yonghao, et al.
Pubblicazione: (2026) -
Bias Beyond Demographics: Probing Decision Boundaries in Black-Box LVLMs via Counterfactual VQA
di: Zhao, Zaiying, et al.
Pubblicazione: (2025) -
Unified Vector Floorplan Generation via Markup Representation
di: Shiohara, Kaede, et al.
Pubblicazione: (2026)