Saved in:
Bibliographic Details
Main Authors: Chen, Zizhi, Han, Minghao, Zhang, Xukun, Ma, Shuwei, Liu, Tao, Wei, Xing, Zhang, Lihua
Format: Preprint
Published: 2025
Subjects:
Online Access:https://arxiv.org/abs/2503.19367
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866912452547969024
author Chen, Zizhi
Han, Minghao
Zhang, Xukun
Ma, Shuwei
Liu, Tao
Wei, Xing
Zhang, Lihua
author_facet Chen, Zizhi
Han, Minghao
Zhang, Xukun
Ma, Shuwei
Liu, Tao
Wei, Xing
Zhang, Lihua
contents Multimodal learning combining pathology images and genomic sequences enhances cancer survival analysis but faces clinical implementation barriers due to limited access to genomic sequencing in under-resourced regions. To enable survival prediction using only whole-slide images (WSI), we propose the Visual-Genomic Answering-Guided Transformer (VGAT), a framework integrating Visual Question Answering (VQA) techniques for genomic modality reconstruction. By adapting VQA's text feature extraction approach, we derive stable genomic representations that circumvent dimensionality challenges in raw genomic data. Simultaneously, a cluster-based visual prompt module selectively enhances discriminative WSI patches, addressing noise from unfiltered image regions. Evaluated across five TCGA datasets, VGAT outperforms existing WSI-only methods, demonstrating the viability of genomic-informed inference without sequencing. This approach bridges multimodal research and clinical feasibility in resource-constrained settings. The code link is https://github.com/CZZZZZZZZZZZZZZZZZ/VGAT.
format Preprint
id arxiv_https___arxiv_org_abs_2503_19367
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle VGAT: A Cancer Survival Analysis Framework Transitioning from Generative Visual Question Answering to Genomic Reconstruction
Chen, Zizhi
Han, Minghao
Zhang, Xukun
Ma, Shuwei
Liu, Tao
Wei, Xing
Zhang, Lihua
Computer Vision and Pattern Recognition
Multimodal learning combining pathology images and genomic sequences enhances cancer survival analysis but faces clinical implementation barriers due to limited access to genomic sequencing in under-resourced regions. To enable survival prediction using only whole-slide images (WSI), we propose the Visual-Genomic Answering-Guided Transformer (VGAT), a framework integrating Visual Question Answering (VQA) techniques for genomic modality reconstruction. By adapting VQA's text feature extraction approach, we derive stable genomic representations that circumvent dimensionality challenges in raw genomic data. Simultaneously, a cluster-based visual prompt module selectively enhances discriminative WSI patches, addressing noise from unfiltered image regions. Evaluated across five TCGA datasets, VGAT outperforms existing WSI-only methods, demonstrating the viability of genomic-informed inference without sequencing. This approach bridges multimodal research and clinical feasibility in resource-constrained settings. The code link is https://github.com/CZZZZZZZZZZZZZZZZZ/VGAT.
title VGAT: A Cancer Survival Analysis Framework Transitioning from Generative Visual Question Answering to Genomic Reconstruction
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2503.19367