Multimodal Fine-grained Reasoning for Post Quality Evaluation

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Guo, Xiaoxu, Liang, Siyan, Cui, Yachao, Zhou, Juxiang, Wang, Lei, Cao, Han
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866916861038297088
author Guo, Xiaoxu
Liang, Siyan
Cui, Yachao
Zhou, Juxiang
Wang, Lei
Cao, Han
author_facet Guo, Xiaoxu
Liang, Siyan
Cui, Yachao
Zhou, Juxiang
Wang, Lei
Cao, Han
contents Accurately assessing post quality requires complex relational reasoning to capture nuanced topic-post relationships. However, existing studies face three major limitations: (1) treating the task as unimodal categorization, which fails to leverage multimodal cues and fine-grained quality distinctions; (2) introducing noise during deep multimodal fusion, leading to misleading signals; and (3) lacking the ability to capture complex semantic relationships like relevance and comprehensiveness. To address these issues, we propose the Multimodal Fine-grained Topic-post Relational Reasoning (MFTRR) framework, which mimics human cognitive processes. MFTRR reframes post-quality assessment as a ranking task and incorporates multimodal data to better capture quality variations. It consists of two key modules: (1) the Local-Global Semantic Correlation Reasoning Module, which models fine-grained semantic interactions between posts and topics at both local and global levels, enhanced by a maximum information fusion mechanism to suppress noise; and (2) the Multi-Level Evidential Relational Reasoning Module, which explores macro- and micro-level relational cues to strengthen evidence-based reasoning. We evaluate MFTRR on three newly constructed multimodal topic-post datasets and the public Lazada-Home dataset. Experimental results demonstrate that MFTRR significantly outperforms state-of-the-art baselines, achieving up to 9.52% NDCG@3 improvement over the best unimodal method on the Art History dataset.
format Preprint
id arxiv_https___arxiv_org_abs_2507_17934
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Multimodal Fine-grained Reasoning for Post Quality Evaluation
Guo, Xiaoxu
Liang, Siyan
Cui, Yachao
Zhou, Juxiang
Wang, Lei
Cao, Han
Machine Learning
Artificial Intelligence
Accurately assessing post quality requires complex relational reasoning to capture nuanced topic-post relationships. However, existing studies face three major limitations: (1) treating the task as unimodal categorization, which fails to leverage multimodal cues and fine-grained quality distinctions; (2) introducing noise during deep multimodal fusion, leading to misleading signals; and (3) lacking the ability to capture complex semantic relationships like relevance and comprehensiveness. To address these issues, we propose the Multimodal Fine-grained Topic-post Relational Reasoning (MFTRR) framework, which mimics human cognitive processes. MFTRR reframes post-quality assessment as a ranking task and incorporates multimodal data to better capture quality variations. It consists of two key modules: (1) the Local-Global Semantic Correlation Reasoning Module, which models fine-grained semantic interactions between posts and topics at both local and global levels, enhanced by a maximum information fusion mechanism to suppress noise; and (2) the Multi-Level Evidential Relational Reasoning Module, which explores macro- and micro-level relational cues to strengthen evidence-based reasoning. We evaluate MFTRR on three newly constructed multimodal topic-post datasets and the public Lazada-Home dataset. Experimental results demonstrate that MFTRR significantly outperforms state-of-the-art baselines, achieving up to 9.52% NDCG@3 improvement over the best unimodal method on the Art History dataset.
title Multimodal Fine-grained Reasoning for Post Quality Evaluation
topic Machine Learning
Artificial Intelligence
url https://arxiv.org/abs/2507.17934