Saved in:
| Main Authors: | Nabeoka, Takuto, Duan, Yijun, Ma, Qiang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2505.15629 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
by: Ouyang, Pengxiang, et al.
Published: (2025)
by: Ouyang, Pengxiang, et al.
Published: (2025)
A Fast Text-Driven Approach for Generating Artistic Content
by: Lupascu, Marian, et al.
Published: (2022)
by: Lupascu, Marian, et al.
Published: (2022)
Probing Commonsense Reasoning Capability of Text-to-Image Generative Models via Non-visual Description
by: Pan, Mianzhi, et al.
Published: (2023)
by: Pan, Mianzhi, et al.
Published: (2023)
SPP-SCL: Semi-Push-Pull Supervised Contrastive Learning for Image-Text Sentiment Analysis and Beyond
by: Wu, Jiesheng, et al.
Published: (2026)
by: Wu, Jiesheng, et al.
Published: (2026)
RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models
by: Cheng, Yu, et al.
Published: (2025)
by: Cheng, Yu, et al.
Published: (2025)
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
by: Li, Ran, et al.
Published: (2025)
by: Li, Ran, et al.
Published: (2025)
Towards Alleviating Text-to-Image Retrieval Hallucination for CLIP in Zero-shot Learning
by: Wang, Hanyao, et al.
Published: (2024)
by: Wang, Hanyao, et al.
Published: (2024)
TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement
by: Ma, Zhiyong, et al.
Published: (2025)
by: Ma, Zhiyong, et al.
Published: (2025)
PopSim: Social Network Simulation for Social Media Popularity Prediction
by: Liu, Yijun, et al.
Published: (2025)
by: Liu, Yijun, et al.
Published: (2025)
AsCL: An Asymmetry-sensitive Contrastive Learning Method for Image-Text Retrieval with Cross-Modal Fusion
by: Gong, Ziyu, et al.
Published: (2024)
by: Gong, Ziyu, et al.
Published: (2024)
TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
Efficient and Accurate Image Provenance Analysis: A Scalable Pipeline for Large-scale Images
by: Lai, Jiewei, et al.
Published: (2025)
by: Lai, Jiewei, et al.
Published: (2025)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
by: Yang, Danni, et al.
Published: (2024)
by: Yang, Danni, et al.
Published: (2024)
Enhancing Image-Text Matching with Adaptive Feature Aggregation
by: Wang, Zuhui, et al.
Published: (2024)
by: Wang, Zuhui, et al.
Published: (2024)
RETRACTION: English Writing Correction Based on Intelligent Text Semantic Analysis
by: Advances in Multimedia
Published: (2025)
by: Advances in Multimedia
Published: (2025)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
by: Xiao, Jian, et al.
Published: (2024)
by: Xiao, Jian, et al.
Published: (2024)
Synthesizing Sentiment-Controlled Feedback For Multimodal Text and Image Data
by: Kumar, Puneet, et al.
Published: (2024)
by: Kumar, Puneet, et al.
Published: (2024)
On Copyright Risks of Text-to-Image Diffusion Models
by: Zhang, Yang, et al.
Published: (2023)
by: Zhang, Yang, et al.
Published: (2023)
Images Inpainting Quality Evaluation Using Structural Features and Visual Saliency
by: Shuang Ma, et al.
Published: (2024)
by: Shuang Ma, et al.
Published: (2024)
Generating Digital Models Using Text-to-3D and Image-to-3D Prompts: Critical Case Study
by: Ziatdinov, Rushan, et al.
Published: (2025)
by: Ziatdinov, Rushan, et al.
Published: (2025)
TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis
by: Quan, Weize, et al.
Published: (2024)
by: Quan, Weize, et al.
Published: (2024)
Audio Visual Segmentation Through Text Embeddings
by: Lee, Kyungbok, et al.
Published: (2025)
by: Lee, Kyungbok, et al.
Published: (2025)
Human-centered Interactive Learning via MLLMs for Text-to-Image Person Re-identification
by: Qin, Yang, et al.
Published: (2025)
by: Qin, Yang, et al.
Published: (2025)
Scaling Prompt Instructed Zero Shot Composed Image Retrieval with Image-Only Data
by: Duan, Yiqun, et al.
Published: (2025)
by: Duan, Yiqun, et al.
Published: (2025)
Differentially Processed Optimized Collaborative Rich Text Editor
by: Jatana, Nishtha, et al.
Published: (2024)
by: Jatana, Nishtha, et al.
Published: (2024)
Prototypical Prompting for Text-to-image Person Re-identification
by: Yan, Shuanglin, et al.
Published: (2024)
by: Yan, Shuanglin, et al.
Published: (2024)
Accelerating End-to-End PDF to Markdown Conversion Through Assisted Generation
by: Duan, Changxu
Published: (2025)
by: Duan, Changxu
Published: (2025)
CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval
by: Qin, Yawen, et al.
Published: (2026)
by: Qin, Yawen, et al.
Published: (2026)
HeadsetOff: Enabling Photorealistic Video Conferencing on Economical VR Headsets
by: Jin, Yili, et al.
Published: (2024)
by: Jin, Yili, et al.
Published: (2024)
Towards Holistic Language-video Representation: the language model-enhanced MSR-Video to Text Dataset
by: Yang, Yuchen, et al.
Published: (2024)
by: Yang, Yuchen, et al.
Published: (2024)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
by: Qiao, Xiangshuo, et al.
Published: (2024)
by: Qiao, Xiangshuo, et al.
Published: (2024)
Layout-Aware Text Editing for Efficient Transformation of Academic PDFs to Markdown
by: Duan, Changxu
Published: (2025)
by: Duan, Changxu
Published: (2025)
Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
by: Wang, Yongqi, et al.
Published: (2025)
by: Wang, Yongqi, et al.
Published: (2025)
ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long Documents
by: Yang, Tianyu, et al.
Published: (2025)
by: Yang, Tianyu, et al.
Published: (2025)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
by: Yang, Shuyu, et al.
Published: (2024)
by: Yang, Shuyu, et al.
Published: (2024)
What's Wrong with the Bottom-up Methods in Arbitrary-shape Scene Text Detection
by: Xu, Chengpei, et al.
Published: (2021)
by: Xu, Chengpei, et al.
Published: (2021)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
by: Chen, Junyu, et al.
Published: (2025)
by: Chen, Junyu, et al.
Published: (2025)
HarmonyIQA: Pioneering Benchmark and Model for Image Harmonization Quality Assessment
by: Xu, Zitong, et al.
Published: (2025)
by: Xu, Zitong, et al.
Published: (2025)
Noisy-Correspondence Learning for Text-to-Image Person Re-identification
by: Qin, Yang, et al.
Published: (2023)
by: Qin, Yang, et al.
Published: (2023)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
by: Wang, Yuyue, et al.
Published: (2025)
by: Wang, Yuyue, et al.
Published: (2025)
Similar Items
-
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
by: Ouyang, Pengxiang, et al.
Published: (2025) -
A Fast Text-Driven Approach for Generating Artistic Content
by: Lupascu, Marian, et al.
Published: (2022) -
Probing Commonsense Reasoning Capability of Text-to-Image Generative Models via Non-visual Description
by: Pan, Mianzhi, et al.
Published: (2023) -
SPP-SCL: Semi-Push-Pull Supervised Contrastive Learning for Image-Text Sentiment Analysis and Beyond
by: Wu, Jiesheng, et al.
Published: (2026) -
RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models
by: Cheng, Yu, et al.
Published: (2025)