See Detail Say Clear: Towards Brain CT Report Generation via Pathological Clue-driven Representation Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Chengxin, Ji, Junzhong, Shi, Yanzhao, Zhang, Xiaodan, Qu, Liangqiong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MEPNet: Medical Entity-balanced Prompting Network for Brain CT Report Generation
por: Zhang, Xiaodan, et al.
Publicado: (2025)
por: Zhang, Xiaodan, et al.
Publicado: (2025)
HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding
por: Shi, Yanzhao, et al.
Publicado: (2025)
por: Shi, Yanzhao, et al.
Publicado: (2025)
SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification
por: Wang, Xiaoying, et al.
Publicado: (2026)
por: Wang, Xiaoying, et al.
Publicado: (2026)
Say Cheese! Detail-Preserving Portrait Collection Generation via Natural Language Edits
por: Sun, Zelong, et al.
Publicado: (2026)
por: Sun, Zelong, et al.
Publicado: (2026)
Towards Unified Molecule-Enhanced Pathology Image Representation Learning via Integrating Spatial Transcriptomics
por: Han, Minghao, et al.
Publicado: (2024)
por: Han, Minghao, et al.
Publicado: (2024)
Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment
por: Xie, Xing, et al.
Publicado: (2025)
por: Xie, Xing, et al.
Publicado: (2025)
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
por: Liu, Yexin, et al.
Publicado: (2024)
por: Liu, Yexin, et al.
Publicado: (2024)
DVG-Diffusion: Dual-View Guided Diffusion Model for CT Reconstruction from X-Rays
por: Xie, Xing, et al.
Publicado: (2025)
por: Xie, Xing, et al.
Publicado: (2025)
Pathology Report Generation and Multimodal Representation Learning for Cutaneous Melanocytic Lesions
por: Lucassen, Ruben T., et al.
Publicado: (2025)
por: Lucassen, Ruben T., et al.
Publicado: (2025)
On the Importance of Text Preprocessing for Multimodal Representation Learning and Pathology Report Generation
por: Lucassen, Ruben T., et al.
Publicado: (2025)
por: Lucassen, Ruben T., et al.
Publicado: (2025)
StyleTailor: Towards Personalized Fashion Styling via Hierarchical Negative Feedback
por: Ma, Hongbo, et al.
Publicado: (2025)
por: Ma, Hongbo, et al.
Publicado: (2025)
See it. Say it. Sorted: Agentic System for Compositional Diagram Generation
por: Zhang, Hantao, et al.
Publicado: (2025)
por: Zhang, Hantao, et al.
Publicado: (2025)
Anatomy-Guided Radiology Report Generation with Pathology-Aware Regional Prompts
por: Gao, Yijian, et al.
Publicado: (2024)
por: Gao, Yijian, et al.
Publicado: (2024)
See Further When Clear: Curriculum Consistency Model
por: Liu, Yunpeng, et al.
Publicado: (2024)
por: Liu, Yunpeng, et al.
Publicado: (2024)
Dia-LLaMA: Towards Large Language Model-driven CT Report Generation
por: Chen, Zhixuan, et al.
Publicado: (2024)
por: Chen, Zhixuan, et al.
Publicado: (2024)
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
por: Shi, Chufan, et al.
Publicado: (2026)
por: Shi, Chufan, et al.
Publicado: (2026)
Seeing What You Say: Expressive Image Generation from Speech
por: Lee, Jiyoung, et al.
Publicado: (2025)
por: Lee, Jiyoung, et al.
Publicado: (2025)
Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors
por: Wang, Xiangchen, et al.
Publicado: (2025)
por: Wang, Xiangchen, et al.
Publicado: (2025)
Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation
por: Chang, Chun-Peng, et al.
Publicado: (2025)
por: Chang, Chun-Peng, et al.
Publicado: (2025)
MOT FCG++: Enhanced Representation of Spatio-temporal Motion and Appearance Features
por: Fang, Yanzhao
Publicado: (2024)
por: Fang, Yanzhao
Publicado: (2024)
TRRG: Towards Truthful Radiology Report Generation With Cross-modal Disease Clue Enhanced Large Language Model
por: Wang, Yuhao, et al.
Publicado: (2024)
por: Wang, Yuhao, et al.
Publicado: (2024)
Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow
por: Liu, Chengxin, et al.
Publicado: (2026)
por: Liu, Chengxin, et al.
Publicado: (2026)
The Devil is in the Details: Simple Remedies for Image-to-LiDAR Representation Learning
por: Jo, Wonjun, et al.
Publicado: (2025)
por: Jo, Wonjun, et al.
Publicado: (2025)
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
por: Zheng, Weiying, et al.
Publicado: (2025)
por: Zheng, Weiying, et al.
Publicado: (2025)
Uncovering Latent Pathological Signatures in Pulmonary CT via Cross-Window Knowledge Distillation
por: Peng, Bo, et al.
Publicado: (2026)
por: Peng, Bo, et al.
Publicado: (2026)
Unleashing the Potential of SAM for Medical Adaptation via Hierarchical Decoding
por: Cheng, Zhiheng, et al.
Publicado: (2024)
por: Cheng, Zhiheng, et al.
Publicado: (2024)
Aligning What EEG Can See: Structural Representations for Brain-Vision Matching
por: Tang, Jingyi, et al.
Publicado: (2026)
por: Tang, Jingyi, et al.
Publicado: (2026)
Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding
por: Tang, Feilong, et al.
Publicado: (2025)
por: Tang, Feilong, et al.
Publicado: (2025)
SeeClear: Semantic Distillation Enhances Pixel Condensation for Video Super-Resolution
por: Tang, Qi, et al.
Publicado: (2024)
por: Tang, Qi, et al.
Publicado: (2024)
Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing
por: Liu, Yi, et al.
Publicado: (2026)
por: Liu, Yi, et al.
Publicado: (2026)
Towards Spatial Transcriptomics-driven Pathology Foundation Models
por: Hemker, Konstantin, et al.
Publicado: (2026)
por: Hemker, Konstantin, et al.
Publicado: (2026)
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
por: Yuan, Qianhao, et al.
Publicado: (2026)
por: Yuan, Qianhao, et al.
Publicado: (2026)
DetailFlow: 1D Coarse-to-Fine Autoregressive Image Generation via Next-Detail Prediction
por: Liu, Yiheng, et al.
Publicado: (2025)
por: Liu, Yiheng, et al.
Publicado: (2025)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
por: Lai, Zhengzhao, et al.
Publicado: (2025)
por: Lai, Zhengzhao, et al.
Publicado: (2025)
ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
por: Zhen, Yihao, et al.
Publicado: (2025)
por: Zhen, Yihao, et al.
Publicado: (2025)
Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
por: Cao, Meng, et al.
Publicado: (2025)
por: Cao, Meng, et al.
Publicado: (2025)
Improving Hierarchical Representations of Vectorized HD Maps with Perspective Clues
por: Zhang, Chi, et al.
Publicado: (2024)
por: Zhang, Chi, et al.
Publicado: (2024)
Towards Imperceptible JPEG Image Hiding: Multi-range Representations-driven Adversarial Stego Generation
por: Yang, Junxue, et al.
Publicado: (2025)
por: Yang, Junxue, et al.
Publicado: (2025)
Learning Brain Representation with Hierarchical Visual Embeddings
por: Zheng, Jiawen, et al.
Publicado: (2026)
por: Zheng, Jiawen, et al.
Publicado: (2026)
Prompt Guiding Multi-Scale Adaptive Sparse Representation-driven Network for Low-Dose CT MAR
por: Shi, Baoshun, et al.
Publicado: (2025)
por: Shi, Baoshun, et al.
Publicado: (2025)
Ejemplares similares
-
MEPNet: Medical Entity-balanced Prompting Network for Brain CT Report Generation
por: Zhang, Xiaodan, et al.
Publicado: (2025) -
HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding
por: Shi, Yanzhao, et al.
Publicado: (2025) -
SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification
por: Wang, Xiaoying, et al.
Publicado: (2026) -
Say Cheese! Detail-Preserving Portrait Collection Generation via Natural Language Edits
por: Sun, Zelong, et al.
Publicado: (2026) -
Towards Unified Molecule-Enhanced Pathology Image Representation Learning via Integrating Spatial Transcriptomics
por: Han, Minghao, et al.
Publicado: (2024)