Decoding fMRI Data into Captions using Prefix Language Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Vyacheslav, Kunanbayev, Kassymzhomart, Kim, Dae-Shik |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BrainChat: Decoding Semantic Information from fMRI using Vision-language Pretrained Models
por: Huang, Wanaiu
Publicado: (2024)
por: Huang, Wanaiu
Publicado: (2024)
Modality-Agnostic fMRI Decoding of Vision and Language
por: Nikolaus, Mitja, et al.
Publicado: (2024)
por: Nikolaus, Mitja, et al.
Publicado: (2024)
Seeing Through the Brain: New Insights from Decoding Visual Stimuli with fMRI
por: Huang, Zheng, et al.
Publicado: (2025)
por: Huang, Zheng, et al.
Publicado: (2025)
From Flat to Round: Redefining Brain Decoding with Surface-Based fMRI and Cortex Structure
por: Yu, Sijin, et al.
Publicado: (2025)
por: Yu, Sijin, et al.
Publicado: (2025)
Pattern-Aware Diffusion Synthesis of fMRI/dMRI with Tissue and Microstructural Refinement
por: Shen, Xiongri, et al.
Publicado: (2025)
por: Shen, Xiongri, et al.
Publicado: (2025)
Towards Neural Foundation Models for Vision: Aligning EEG, MEG, and fMRI Representations for Decoding, Encoding, and Modality Conversion
por: Ferrante, Matteo, et al.
Publicado: (2024)
por: Ferrante, Matteo, et al.
Publicado: (2024)
CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design
por: Jeong, Daeheon, et al.
Publicado: (2025)
por: Jeong, Daeheon, et al.
Publicado: (2025)
MindFormer: Semantic Alignment of Multi-Subject fMRI for Brain Decoding
por: Han, Inhwa, et al.
Publicado: (2024)
por: Han, Inhwa, et al.
Publicado: (2024)
The Role of Data Curation in Image Captioning
por: Li, Wenyan, et al.
Publicado: (2023)
por: Li, Wenyan, et al.
Publicado: (2023)
A Novel Dual-Stream Framework for dMRI Tractography Streamline Classification with Joint dMRI and fMRI Data
por: Yan, Haotian, et al.
Publicado: (2025)
por: Yan, Haotian, et al.
Publicado: (2025)
Visually Guided Decoding: Gradient-Free Hard Prompt Inversion with Language Models
por: Kim, Donghoon, et al.
Publicado: (2025)
por: Kim, Donghoon, et al.
Publicado: (2025)
CIC: A Framework for Culturally-Aware Image Captioning
por: Yun, Youngsik, et al.
Publicado: (2024)
por: Yun, Youngsik, et al.
Publicado: (2024)
EXPERT: An Explainable Image Captioning Evaluation Metric with Structured Explanations
por: Kim, Hyunjong, et al.
Publicado: (2025)
por: Kim, Hyunjong, et al.
Publicado: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding
por: Min, Kyungmin, et al.
Publicado: (2024)
por: Min, Kyungmin, et al.
Publicado: (2024)
ChartCap: Mitigating Hallucination of Dense Chart Captioning
por: Lim, Junyoung, et al.
Publicado: (2025)
por: Lim, Junyoung, et al.
Publicado: (2025)
AC-Lite : A Lightweight Image Captioning Model for Low-Resource Assamese Language
por: Choudhury, Pankaj, et al.
Publicado: (2025)
por: Choudhury, Pankaj, et al.
Publicado: (2025)
TexTailor: Customized Text-aligned Texturing via Effective Resampling
por: Lee, Suin, et al.
Publicado: (2025)
por: Lee, Suin, et al.
Publicado: (2025)
Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
por: Bucciarelli, Davide, et al.
Publicado: (2024)
por: Bucciarelli, Davide, et al.
Publicado: (2024)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
por: Kim, Donghoon, et al.
Publicado: (2024)
por: Kim, Donghoon, et al.
Publicado: (2024)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
VIBE: Video-Input Brain Encoder for fMRI Response Modeling
por: Schad, Daniel Carlström, et al.
Publicado: (2025)
por: Schad, Daniel Carlström, et al.
Publicado: (2025)
Imagine How To Change: Explicit Procedure Modeling for Change Captioning
por: Sun, Jiayang, et al.
Publicado: (2026)
por: Sun, Jiayang, et al.
Publicado: (2026)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
por: Lavoie, Samuel, et al.
Publicado: (2024)
por: Lavoie, Samuel, et al.
Publicado: (2024)
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
por: Kim, Si-Woo, et al.
Publicado: (2025)
por: Kim, Si-Woo, et al.
Publicado: (2025)
Explaining Caption-Image Interactions in CLIP Models with Second-Order Attributions
por: Möller, Lucas, et al.
Publicado: (2024)
por: Möller, Lucas, et al.
Publicado: (2024)
The Power of Many: Multi-Agent Multimodal Models for Cultural Image Captioning
por: Bai, Longju, et al.
Publicado: (2024)
por: Bai, Longju, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Vision-Language Models (LVLMs) via Language-Contrastive Decoding (LCD)
por: Manevich, Avshalom, et al.
Publicado: (2024)
por: Manevich, Avshalom, et al.
Publicado: (2024)
Neurons: Emulating the Human Visual Cortex Improves Fidelity and Interpretability in fMRI-to-Video Reconstruction
por: Wang, Haonan, et al.
Publicado: (2025)
por: Wang, Haonan, et al.
Publicado: (2025)
MindEye2: Shared-Subject Models Enable fMRI-To-Image With 1 Hour of Data
por: Scotti, Paul S., et al.
Publicado: (2024)
por: Scotti, Paul S., et al.
Publicado: (2024)
Resource-Efficient Medical Report Generation using Large Language Models
por: Abdullah, et al.
Publicado: (2024)
por: Abdullah, et al.
Publicado: (2024)
Unveiling the Invisible: Captioning Videos with Metaphors
por: Kalarani, Abisek Rajakumar, et al.
Publicado: (2024)
por: Kalarani, Abisek Rajakumar, et al.
Publicado: (2024)
Text-only Synthesis for Image Captioning
por: Zhou, Qing, et al.
Publicado: (2024)
por: Zhou, Qing, et al.
Publicado: (2024)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
por: Lee, Yi-Lun, et al.
Publicado: (2024)
por: Lee, Yi-Lun, et al.
Publicado: (2024)
Region-Aware Reconstruction Strategy for Pre-training fMRI Foundation Model
por: Doodipala, Ruthwik Reddy, et al.
Publicado: (2025)
por: Doodipala, Ruthwik Reddy, et al.
Publicado: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
por: Kang, Choongwon, et al.
Publicado: (2026)
por: Kang, Choongwon, et al.
Publicado: (2026)
LAViTeR: Learning Aligned Visual and Textual Representations Assisted by Image and Caption Generation
por: Hashemi, Mohammad Abuzar, et al.
Publicado: (2021)
por: Hashemi, Mohammad Abuzar, et al.
Publicado: (2021)
Updating CLIP to Prefer Descriptions Over Captions
por: Zur, Amir, et al.
Publicado: (2024)
por: Zur, Amir, et al.
Publicado: (2024)
CognArtive: Large Language Models for Automating Art Analysis and Decoding Aesthetic Elements
por: Khadangi, Afshin, et al.
Publicado: (2025)
por: Khadangi, Afshin, et al.
Publicado: (2025)
Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution
por: Qin, Tian, et al.
Publicado: (2026)
por: Qin, Tian, et al.
Publicado: (2026)
Ejemplares similares
-
BrainChat: Decoding Semantic Information from fMRI using Vision-language Pretrained Models
por: Huang, Wanaiu
Publicado: (2024) -
Modality-Agnostic fMRI Decoding of Vision and Language
por: Nikolaus, Mitja, et al.
Publicado: (2024) -
Seeing Through the Brain: New Insights from Decoding Visual Stimuli with fMRI
por: Huang, Zheng, et al.
Publicado: (2025) -
From Flat to Round: Redefining Brain Decoding with Surface-Based fMRI and Cortex Structure
por: Yu, Sijin, et al.
Publicado: (2025) -
Pattern-Aware Diffusion Synthesis of fMRI/dMRI with Tissue and Microstructural Refinement
por: Shen, Xiongri, et al.
Publicado: (2025)