Grounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual Consistency
Fuente:
arXiv
Guardado en:
| Autores principales: | Morbiato, Filippo, Romano, Luca, Persona, Alessandro |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation
por: Yang, Cunyuan, et al.
Publicado: (2026)
por: Yang, Cunyuan, et al.
Publicado: (2026)
Can VLMs Recall Factual Associations From Visual References?
por: Ashok, Dhananjay, et al.
Publicado: (2025)
por: Ashok, Dhananjay, et al.
Publicado: (2025)
VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
por: Dipta, Shubhashis Roy, et al.
Publicado: (2025)
por: Dipta, Shubhashis Roy, et al.
Publicado: (2025)
Towards Statistical Factuality Guarantee for Large Vision-Language Models
por: Li, Zhuohang, et al.
Publicado: (2025)
por: Li, Zhuohang, et al.
Publicado: (2025)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
LLM-RG4: Flexible and Factual Radiology Report Generation across Diverse Input Contexts
por: Wang, Zhuhao, et al.
Publicado: (2024)
por: Wang, Zhuhao, et al.
Publicado: (2024)
KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality
por: Ren, Baochang, et al.
Publicado: (2025)
por: Ren, Baochang, et al.
Publicado: (2025)
T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts
por: Huang, Ziwei, et al.
Publicado: (2024)
por: Huang, Ziwei, et al.
Publicado: (2024)
FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models
por: Lim, Youngsun, et al.
Publicado: (2026)
por: Lim, Youngsun, et al.
Publicado: (2026)
Factuality Matters: When Image Generation and Editing Meet Structured Visuals
por: Zhuo, Le, et al.
Publicado: (2025)
por: Zhuo, Le, et al.
Publicado: (2025)
OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation
por: Chen, Zhuoxiao, et al.
Publicado: (2025)
por: Chen, Zhuoxiao, et al.
Publicado: (2025)
The Factuality Tax of Diversity-Intervened Text-to-Image Generation: Benchmark and Fact-Augmented Intervention
por: Wan, Yixin, et al.
Publicado: (2024)
por: Wan, Yixin, et al.
Publicado: (2024)
RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
The Curious Case of Factuality Finetuning: Models' Internal Beliefs Can Improve Factuality
por: Newman, Benjamin, et al.
Publicado: (2025)
por: Newman, Benjamin, et al.
Publicado: (2025)
Revolutionizing Radiology Workflow with Factual and Efficient CXR Report Generation
por: Sukjai, Pimchanok, et al.
Publicado: (2025)
por: Sukjai, Pimchanok, et al.
Publicado: (2025)
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
por: Wysoczańska, Monika, et al.
Publicado: (2025)
por: Wysoczańska, Monika, et al.
Publicado: (2025)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
por: Cao, Meng, et al.
Publicado: (2025)
por: Cao, Meng, et al.
Publicado: (2025)
Understanding Finetuning for Factual Knowledge Extraction
por: Ghosal, Gaurav, et al.
Publicado: (2024)
por: Ghosal, Gaurav, et al.
Publicado: (2024)
AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing
por: Wang, Tianbo, et al.
Publicado: (2026)
por: Wang, Tianbo, et al.
Publicado: (2026)
FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning
por: Chen, Weidong, et al.
Publicado: (2026)
por: Chen, Weidong, et al.
Publicado: (2026)
MedFact-R1: Towards Factual Medical Reasoning via Pseudo-Label Augmentation
por: Li, Gengliang, et al.
Publicado: (2025)
por: Li, Gengliang, et al.
Publicado: (2025)
Beyond Detection: Multi-Scale Hidden-Code for Natural Image Deepfake Recovery and Factual Retrieval
por: Chen, Yuan-Chih, et al.
Publicado: (2026)
por: Chen, Yuan-Chih, et al.
Publicado: (2026)
Similarity over Factuality: Are we making progress on multimodal out-of-context misinformation detection?
por: Papadopoulos, Stefanos-Iordanis, et al.
Publicado: (2024)
por: Papadopoulos, Stefanos-Iordanis, et al.
Publicado: (2024)
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
por: Yang, Junqi, et al.
Publicado: (2026)
por: Yang, Junqi, et al.
Publicado: (2026)
Addressing Image Hallucination in Text-to-Image Generation through Factual Image Retrieval
por: Lim, Youngsun, et al.
Publicado: (2024)
por: Lim, Youngsun, et al.
Publicado: (2024)
Multi-Modal Hallucination Control by Visual Information Grounding
por: Favero, Alessandro, et al.
Publicado: (2024)
por: Favero, Alessandro, et al.
Publicado: (2024)
Open Multimodal Retrieval-Augmented Factual Image Generation
por: Tian, Yang, et al.
Publicado: (2025)
por: Tian, Yang, et al.
Publicado: (2025)
Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage
por: Lee, Saehyung, et al.
Publicado: (2024)
por: Lee, Saehyung, et al.
Publicado: (2024)
Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework
por: Xiao, Kelaiti, et al.
Publicado: (2025)
por: Xiao, Kelaiti, et al.
Publicado: (2025)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
por: Kuang, Jiayi, et al.
Publicado: (2024)
por: Kuang, Jiayi, et al.
Publicado: (2024)
Using Similarity to Evaluate Factual Consistency in Summaries
por: Ye, Yuxuan, et al.
Publicado: (2024)
por: Ye, Yuxuan, et al.
Publicado: (2024)
Beyond Generation: Multi-Hop Reasoning for Factual Accuracy in Vision-Language Models
por: Hossain, Shamima
Publicado: (2025)
por: Hossain, Shamima
Publicado: (2025)
Improving Visual Grounding by Encouraging Consistent Gradient-based Explanations
por: Yang, Ziyan, et al.
Publicado: (2022)
por: Yang, Ziyan, et al.
Publicado: (2022)
Watermarking for Factuality: Guiding Vision-Language Models Toward Truth via Tri-layer Contrastive Decoding
por: Back, Kyungryul, et al.
Publicado: (2025)
por: Back, Kyungryul, et al.
Publicado: (2025)
GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images
por: Lan, Xiang, et al.
Publicado: (2025)
por: Lan, Xiang, et al.
Publicado: (2025)
HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs
por: Zhang, Zijian, et al.
Publicado: (2025)
por: Zhang, Zijian, et al.
Publicado: (2025)
AnchorOPT: Towards Optimizing Dynamic Anchors for Adaptive Prompt Learning
por: Li, Zheng, et al.
Publicado: (2025)
por: Li, Zheng, et al.
Publicado: (2025)
Learning to Reason for Factuality
por: Chen, Xilun, et al.
Publicado: (2025)
por: Chen, Xilun, et al.
Publicado: (2025)
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
por: Shahgir, Haz Sameen, et al.
Publicado: (2026)
por: Shahgir, Haz Sameen, et al.
Publicado: (2026)
mFACE: Multilingual Summarization with Factual Consistency Evaluation
por: Aharoni, Roee, et al.
Publicado: (2022)
por: Aharoni, Roee, et al.
Publicado: (2022)
Ejemplares similares
-
LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation
por: Yang, Cunyuan, et al.
Publicado: (2026) -
Can VLMs Recall Factual Associations From Visual References?
por: Ashok, Dhananjay, et al.
Publicado: (2025) -
VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
por: Dipta, Shubhashis Roy, et al.
Publicado: (2025) -
Towards Statistical Factuality Guarantee for Large Vision-Language Models
por: Li, Zhuohang, et al.
Publicado: (2025) -
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
por: Gu, Jihao, et al.
Publicado: (2025)