RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yuchi, Cai, Yishuo, Ren, Shuhuai, Yang, Sihan, Yao, Linli, Liu, Yuanxin, Zhang, Yuanxing, Wan, Pengfei, Sun, Xu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
by: Wang, Yuchi, et al.
Published: (2024)
by: Wang, Yuchi, et al.
Published: (2024)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
by: Ren, Shuhuai, et al.
Published: (2023)
by: Ren, Shuhuai, et al.
Published: (2023)
What If We Recaption Billions of Web Images with LLaMA-3?
by: Li, Xianhang, et al.
Published: (2024)
by: Li, Xianhang, et al.
Published: (2024)
Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
by: Ouyang, Kun, et al.
Published: (2025)
by: Ouyang, Kun, et al.
Published: (2025)
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
by: Yao, Linli, et al.
Published: (2024)
by: Yao, Linli, et al.
Published: (2024)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
by: Li, Shicheng, et al.
Published: (2023)
by: Li, Shicheng, et al.
Published: (2023)
Temporal Reasoning Transfer from Text to Video
by: Li, Lei, et al.
Published: (2024)
by: Li, Lei, et al.
Published: (2024)
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
by: Yao, Linli, et al.
Published: (2025)
by: Yao, Linli, et al.
Published: (2025)
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
by: Chen, Xinlong, et al.
Published: (2026)
by: Chen, Xinlong, et al.
Published: (2026)
Dual-Head Reasoning Distillation: Improving Classifier Accuracy with Train-Time-Only Reasoning
by: Xu, Jillian, et al.
Published: (2025)
by: Xu, Jillian, et al.
Published: (2025)
A Multimodal Recaptioning Framework to Account for Perceptual Diversity Across Languages in Vision-Language Modeling
by: Buettner, Kyle, et al.
Published: (2025)
by: Buettner, Kyle, et al.
Published: (2025)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
by: Chen, Liang, et al.
Published: (2024)
by: Chen, Liang, et al.
Published: (2024)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
by: Guan, Shuhao, et al.
Published: (2025)
by: Guan, Shuhao, et al.
Published: (2025)
VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval
by: Wu, Di, et al.
Published: (2025)
by: Wu, Di, et al.
Published: (2025)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
by: Li, Shicheng, et al.
Published: (2025)
by: Li, Shicheng, et al.
Published: (2025)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
by: Yao, Linli, et al.
Published: (2026)
by: Yao, Linli, et al.
Published: (2026)
TVIR: Building Deep Research Agents Towards Text--Visual Interleaved Report Generation
by: Ma, Xinkai, et al.
Published: (2026)
by: Ma, Xinkai, et al.
Published: (2026)
Improving Brain-to-Image Reconstruction via Fine-Grained Text Bridging
by: Xia, Runze, et al.
Published: (2025)
by: Xia, Runze, et al.
Published: (2025)
RICo: Refined In-Context Contribution for Automatic Instruction-Tuning Data Selection
by: Yang, Yixin, et al.
Published: (2025)
by: Yang, Yixin, et al.
Published: (2025)
Evaluating Mathematical Reasoning Beyond Accuracy
by: Xia, Shijie, et al.
Published: (2024)
by: Xia, Shijie, et al.
Published: (2024)
Improving Alignment in LVLMs with Debiased Self-Judgment
by: Yang, Sihan, et al.
Published: (2025)
by: Yang, Sihan, et al.
Published: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
by: Dai, Yifan, et al.
Published: (2026)
by: Dai, Yifan, et al.
Published: (2026)
Insert or Attach: Taxonomy Completion via Box Embedding
by: Xue, Wei, et al.
Published: (2023)
by: Xue, Wei, et al.
Published: (2023)
Improved Neural Protoform Reconstruction via Reflex Prediction
by: Lu, Liang, et al.
Published: (2024)
by: Lu, Liang, et al.
Published: (2024)
Read Quietly, Think Aloud: Decoupling Comprehension and Reasoning in LLMs
by: Wang, Yuanxin, et al.
Published: (2025)
by: Wang, Yuanxin, et al.
Published: (2025)
ERAGent: Enhancing Retrieval-Augmented Language Models with Improved Accuracy, Efficiency, and Personalization
by: Shi, Yunxiao, et al.
Published: (2024)
by: Shi, Yunxiao, et al.
Published: (2024)
Reconstructing KV Caches with Cross-layer Fusion For Enhanced Transformers
by: Lin, Hongzhan, et al.
Published: (2025)
by: Lin, Hongzhan, et al.
Published: (2025)
UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?
by: Liu, Yuanxin, et al.
Published: (2025)
by: Liu, Yuanxin, et al.
Published: (2025)
Unifying Continuous and Discrete Text Diffusion with Non-simultaneous Diffusion Processes
by: Li, Bocheng, et al.
Published: (2025)
by: Li, Bocheng, et al.
Published: (2025)
nvAgent: Automated Data Visualization from Natural Language via Collaborative Agent Workflow
by: Ouyang, Geliang, et al.
Published: (2025)
by: Ouyang, Geliang, et al.
Published: (2025)
Conversational Recommender System and Large Language Model Are Made for Each Other in E-commerce Pre-sales Dialogue
by: Liu, Yuanxing, et al.
Published: (2023)
by: Liu, Yuanxing, et al.
Published: (2023)
Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
by: Yang, Ling, et al.
Published: (2024)
by: Yang, Ling, et al.
Published: (2024)
Thinking with Drafting: Optical Decompression via Logical Reconstruction
by: Wei, Jingxuan, et al.
Published: (2026)
by: Wei, Jingxuan, et al.
Published: (2026)
LLMs Know More About Numbers than They Can Say
by: Yuchi, Fengting, et al.
Published: (2026)
by: Yuchi, Fengting, et al.
Published: (2026)
FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions
by: Zhao, Peisen, et al.
Published: (2026)
by: Zhao, Peisen, et al.
Published: (2026)
One RL to See Them All: Visual Triple Unified Reinforcement Learning
by: Ma, Yan, et al.
Published: (2025)
by: Ma, Yan, et al.
Published: (2025)
Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
by: Teng, Matthew Kit Khinn, et al.
Published: (2025)
by: Teng, Matthew Kit Khinn, et al.
Published: (2025)
GIT-Mol: A Multi-modal Large Language Model for Molecular Science with Graph, Image, and Text
by: Liu, Pengfei, et al.
Published: (2023)
by: Liu, Pengfei, et al.
Published: (2023)
Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA
by: Chen, Guanhua, et al.
Published: (2026)
by: Chen, Guanhua, et al.
Published: (2026)
A Structured Dataset of Disease-Symptom Associations to Improve Diagnostic Accuracy
by: Shafi, Abdullah Al, et al.
Published: (2025)
by: Shafi, Abdullah Al, et al.
Published: (2025)
Similar Items
-
LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
by: Wang, Yuchi, et al.
Published: (2024) -
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
by: Ren, Shuhuai, et al.
Published: (2023) -
What If We Recaption Billions of Web Images with LLaMA-3?
by: Li, Xianhang, et al.
Published: (2024) -
Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
by: Ouyang, Kun, et al.
Published: (2025) -
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
by: Yao, Linli, et al.
Published: (2024)