Relationship Analysis of Image-Text Pair in SNS Posts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nabeoka, Takuto, Duan, Yijun, Ma, Qiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
par: Ouyang, Pengxiang, et autres
Publié: (2025)
par: Ouyang, Pengxiang, et autres
Publié: (2025)
SPP-SCL: Semi-Push-Pull Supervised Contrastive Learning for Image-Text Sentiment Analysis and Beyond
par: Wu, Jiesheng, et autres
Publié: (2026)
par: Wu, Jiesheng, et autres
Publié: (2026)
Probing Commonsense Reasoning Capability of Text-to-Image Generative Models via Non-visual Description
par: Pan, Mianzhi, et autres
Publié: (2023)
par: Pan, Mianzhi, et autres
Publié: (2023)
A Fast Text-Driven Approach for Generating Artistic Content
par: Lupascu, Marian, et autres
Publié: (2022)
par: Lupascu, Marian, et autres
Publié: (2022)
RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models
par: Cheng, Yu, et autres
Publié: (2025)
par: Cheng, Yu, et autres
Publié: (2025)
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
par: Li, Ran, et autres
Publié: (2025)
par: Li, Ran, et autres
Publié: (2025)
Towards Alleviating Text-to-Image Retrieval Hallucination for CLIP in Zero-shot Learning
par: Wang, Hanyao, et autres
Publié: (2024)
par: Wang, Hanyao, et autres
Publié: (2024)
AsCL: An Asymmetry-sensitive Contrastive Learning Method for Image-Text Retrieval with Cross-Modal Fusion
par: Gong, Ziyu, et autres
Publié: (2024)
par: Gong, Ziyu, et autres
Publié: (2024)
TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement
par: Ma, Zhiyong, et autres
Publié: (2025)
par: Ma, Zhiyong, et autres
Publié: (2025)
Efficient and Accurate Image Provenance Analysis: A Scalable Pipeline for Large-scale Images
par: Lai, Jiewei, et autres
Publié: (2025)
par: Lai, Jiewei, et autres
Publié: (2025)
TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
PopSim: Social Network Simulation for Social Media Popularity Prediction
par: Liu, Yijun, et autres
Publié: (2025)
par: Liu, Yijun, et autres
Publié: (2025)
RETRACTION: English Writing Correction Based on Intelligent Text Semantic Analysis
par: Advances in Multimedia
Publié: (2025)
par: Advances in Multimedia
Publié: (2025)
Enhancing Image-Text Matching with Adaptive Feature Aggregation
par: Wang, Zuhui, et autres
Publié: (2024)
par: Wang, Zuhui, et autres
Publié: (2024)
Synthesizing Sentiment-Controlled Feedback For Multimodal Text and Image Data
par: Kumar, Puneet, et autres
Publié: (2024)
par: Kumar, Puneet, et autres
Publié: (2024)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
par: Yang, Danni, et autres
Publié: (2024)
par: Yang, Danni, et autres
Publié: (2024)
Images Inpainting Quality Evaluation Using Structural Features and Visual Saliency
par: Shuang Ma, et autres
Publié: (2024)
par: Shuang Ma, et autres
Publié: (2024)
On Copyright Risks of Text-to-Image Diffusion Models
par: Zhang, Yang, et autres
Publié: (2023)
par: Zhang, Yang, et autres
Publié: (2023)
Generating Digital Models Using Text-to-3D and Image-to-3D Prompts: Critical Case Study
par: Ziatdinov, Rushan, et autres
Publié: (2025)
par: Ziatdinov, Rushan, et autres
Publié: (2025)
Differentially Processed Optimized Collaborative Rich Text Editor
par: Jatana, Nishtha, et autres
Publié: (2024)
par: Jatana, Nishtha, et autres
Publié: (2024)
Prototypical Prompting for Text-to-image Person Re-identification
par: Yan, Shuanglin, et autres
Publié: (2024)
par: Yan, Shuanglin, et autres
Publié: (2024)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024)
par: Xiao, Jian, et autres
Publié: (2024)
TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis
par: Quan, Weize, et autres
Publié: (2024)
par: Quan, Weize, et autres
Publié: (2024)
CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval
par: Qin, Yawen, et autres
Publié: (2026)
par: Qin, Yawen, et autres
Publié: (2026)
Human-centered Interactive Learning via MLLMs for Text-to-Image Person Re-identification
par: Qin, Yang, et autres
Publié: (2025)
par: Qin, Yang, et autres
Publié: (2025)
Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
par: Wang, Yongqi, et autres
Publié: (2025)
par: Wang, Yongqi, et autres
Publié: (2025)
HeadsetOff: Enabling Photorealistic Video Conferencing on Economical VR Headsets
par: Jin, Yili, et autres
Publié: (2024)
par: Jin, Yili, et autres
Publié: (2024)
What's Wrong with the Bottom-up Methods in Arbitrary-shape Scene Text Detection
par: Xu, Chengpei, et autres
Publié: (2021)
par: Xu, Chengpei, et autres
Publié: (2021)
Evaluation of Objective Image Quality Metrics for High-Fidelity Image Compression
par: Mohammadi, Shima, et autres
Publié: (2025)
par: Mohammadi, Shima, et autres
Publié: (2025)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
par: Wang, Yuyue, et autres
Publié: (2025)
par: Wang, Yuyue, et autres
Publié: (2025)
Accelerating End-to-End PDF to Markdown Conversion Through Assisted Generation
par: Duan, Changxu
Publié: (2025)
par: Duan, Changxu
Publié: (2025)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing
par: Chen, Yaru, et autres
Publié: (2025)
par: Chen, Yaru, et autres
Publié: (2025)
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
par: Zhang, Han, et autres
Publié: (2025)
par: Zhang, Han, et autres
Publié: (2025)
Scaling Prompt Instructed Zero Shot Composed Image Retrieval with Image-Only Data
par: Duan, Yiqun, et autres
Publié: (2025)
par: Duan, Yiqun, et autres
Publié: (2025)
Audio Visual Segmentation Through Text Embeddings
par: Lee, Kyungbok, et autres
Publié: (2025)
par: Lee, Kyungbok, et autres
Publié: (2025)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
par: Qiao, Xiangshuo, et autres
Publié: (2024)
par: Qiao, Xiangshuo, et autres
Publié: (2024)
Ges-QA: A Multidimensional Quality Assessment Dataset for Audio-to-3D Gesture Generation
par: Gao, Zhilin, et autres
Publié: (2025)
par: Gao, Zhilin, et autres
Publié: (2025)
SFQA: A Comprehensive Perceptual Quality Assessment Dataset for Singing Face Generation
par: Gao, Zhilin, et autres
Publié: (2026)
par: Gao, Zhilin, et autres
Publié: (2026)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
par: Yang, Shuyu, et autres
Publié: (2024)
par: Yang, Shuyu, et autres
Publié: (2024)
Documents similaires
-
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
par: Ouyang, Pengxiang, et autres
Publié: (2025) -
SPP-SCL: Semi-Push-Pull Supervised Contrastive Learning for Image-Text Sentiment Analysis and Beyond
par: Wu, Jiesheng, et autres
Publié: (2026) -
Probing Commonsense Reasoning Capability of Text-to-Image Generative Models via Non-visual Description
par: Pan, Mianzhi, et autres
Publié: (2023) -
A Fast Text-Driven Approach for Generating Artistic Content
par: Lupascu, Marian, et autres
Publié: (2022) -
RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models
par: Cheng, Yu, et autres
Publié: (2025)