DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Inoue, Nakamasa, Goto, Kanoko, Oi, Masanari, Gruszka, Martyna, Ukai, Mahiro, Hirose, Takumi, Sekikawa, Yusuke |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Referring Expression Comprehension for Small Objects
par: Goto, Kanoko, et autres
Publié: (2025)
par: Goto, Kanoko, et autres
Publié: (2025)
DF-Mamba: Deformable State Space Modeling for 3D Hand Pose Estimation in Interactions
par: Zhou, Yifan, et autres
Publié: (2025)
par: Zhou, Yifan, et autres
Publié: (2025)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
par: Ukai, Mahiro, et autres
Publié: (2025)
par: Ukai, Mahiro, et autres
Publié: (2025)
Multi-Point Positional Insertion Tuning for Small Object Detection
par: Goto, Kanoko, et autres
Publié: (2024)
par: Goto, Kanoko, et autres
Publié: (2024)
Autoregressive Direct Preference Optimization
par: Oi, Masanari, et autres
Publié: (2026)
par: Oi, Masanari, et autres
Publié: (2026)
AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering
par: Ukai, Mahiro, et autres
Publié: (2024)
par: Ukai, Mahiro, et autres
Publié: (2024)
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
par: Tsuchiya, Fumihiko, et autres
Publié: (2026)
par: Tsuchiya, Fumihiko, et autres
Publié: (2026)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
par: Ohi, Masanari, et autres
Publié: (2024)
par: Ohi, Masanari, et autres
Publié: (2024)
From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models
par: Oi, Masanari, et autres
Publié: (2026)
par: Oi, Masanari, et autres
Publié: (2026)
HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis
par: Nishimura, Yuto, et autres
Publié: (2024)
par: Nishimura, Yuto, et autres
Publié: (2024)
ELP-Adapters: Parameter Efficient Adapter Tuning for Various Speech Processing Tasks
par: Inoue, Nakamasa, et autres
Publié: (2024)
par: Inoue, Nakamasa, et autres
Publié: (2024)
Masked Gated Linear Unit
par: Tajima, Yukito, et autres
Publié: (2025)
par: Tajima, Yukito, et autres
Publié: (2025)
MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation
par: Kan, Shichao, et autres
Publié: (2026)
par: Kan, Shichao, et autres
Publié: (2026)
DENEB: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning
par: Matsuda, Kazuki, et autres
Publié: (2024)
par: Matsuda, Kazuki, et autres
Publié: (2024)
Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering
par: Shen, Ruoyue, et autres
Publié: (2024)
par: Shen, Ruoyue, et autres
Publié: (2024)
PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
par: Yokomizo, Hisayuki, et autres
Publié: (2026)
par: Yokomizo, Hisayuki, et autres
Publié: (2026)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
par: Chen, Xiaofu, et autres
Publié: (2025)
par: Chen, Xiaofu, et autres
Publié: (2025)
Redemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal Triangulation
par: Dahal, Ashim, et autres
Publié: (2025)
par: Dahal, Ashim, et autres
Publié: (2025)
GUMBEL-NERF: Representing Unseen Objects as Part-Compositional Neural Radiance Fields
par: Sekikawa, Yusuke, et autres
Publié: (2024)
par: Sekikawa, Yusuke, et autres
Publié: (2024)
Neural Bloom: A Deep Learning Approach to Real-Time Lighting
par: Karp, Rafal, et autres
Publié: (2025)
par: Karp, Rafal, et autres
Publié: (2025)
AnimalClue: Recognizing Animals by their Traces
par: Shinoda, Risa, et autres
Publié: (2025)
par: Shinoda, Risa, et autres
Publié: (2025)
AgroBench: Vision-Language Model Benchmark in Agriculture
par: Shinoda, Risa, et autres
Publié: (2025)
par: Shinoda, Risa, et autres
Publié: (2025)
PowerCLIP: Powerset Alignment for Contrastive Pre-Training
par: Kawamura, Masaki, et autres
Publié: (2025)
par: Kawamura, Masaki, et autres
Publié: (2025)
An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics
par: Ahmadi, Saba, et autres
Publié: (2023)
par: Ahmadi, Saba, et autres
Publié: (2023)
Compressed Image Captioning using CNN-based Encoder-Decoder Framework
par: Ridoy, Md Alif Rahman, et autres
Publié: (2024)
par: Ridoy, Md Alif Rahman, et autres
Publié: (2024)
Rethinking Evaluation Metrics for Grammatical Error Correction: Why Use a Different Evaluation Process than Human?
par: Goto, Takumi, et autres
Publié: (2025)
par: Goto, Takumi, et autres
Publié: (2025)
Visually-Aware Context Modeling for News Image Captioning
par: Qu, Tingyu, et autres
Publié: (2023)
par: Qu, Tingyu, et autres
Publié: (2023)
Synthesizing Instruction-Tuning Datasets with Contrastive Decoding
par: Ichinose, Tatsuya, et autres
Publié: (2026)
par: Ichinose, Tatsuya, et autres
Publié: (2026)
Divide and Restore: A Modular Task-Decoupled Framework for Universal Image Restoration
par: Wiekiera, Joanna, et autres
Publié: (2026)
par: Wiekiera, Joanna, et autres
Publié: (2026)
Grammatical Error Correction Evaluation by Optimally Transporting Edit Representation
par: Goto, Takumi, et autres
Publié: (2026)
par: Goto, Takumi, et autres
Publié: (2026)
Decoding Matters: Efficient Mamba-Based Decoder with Distribution-Aware Deep Supervision for Medical Image Segmentation
par: Bougourzi, Fares, et autres
Publié: (2026)
par: Bougourzi, Fares, et autres
Publié: (2026)
BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment
par: Shinoda, Risa, et autres
Publié: (2026)
par: Shinoda, Risa, et autres
Publié: (2026)
gec-metrics: A Unified Library for Grammatical Error Correction Evaluation
par: Goto, Takumi, et autres
Publié: (2025)
par: Goto, Takumi, et autres
Publié: (2025)
Understanding Retrieval Robustness for Retrieval-Augmented Image Captioning
par: Li, Wenyan, et autres
Publié: (2024)
par: Li, Wenyan, et autres
Publié: (2024)
Is Your Text-to-Image Model Robust to Caption Noise?
par: Yu, Weichen, et autres
Publié: (2024)
par: Yu, Weichen, et autres
Publié: (2024)
Removing Distributional Discrepancies in Captions Improves Image-Text Alignment
par: Li, Yuheng, et autres
Publié: (2024)
par: Li, Yuheng, et autres
Publié: (2024)
HICEScore: A Hierarchical Metric for Image Captioning Evaluation
par: Zeng, Zequn, et autres
Publié: (2024)
par: Zeng, Zequn, et autres
Publié: (2024)
On the Relationship Between Double Descent of CNNs and Shape/Texture Bias Under Learning Process
par: Iwase, Shun, et autres
Publié: (2025)
par: Iwase, Shun, et autres
Publié: (2025)
CIC: A Framework for Culturally-Aware Image Captioning
par: Yun, Youngsik, et autres
Publié: (2024)
par: Yun, Youngsik, et autres
Publié: (2024)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
par: Cui, Tianyu, et autres
Publié: (2025)
par: Cui, Tianyu, et autres
Publié: (2025)
Documents similaires
-
Referring Expression Comprehension for Small Objects
par: Goto, Kanoko, et autres
Publié: (2025) -
DF-Mamba: Deformable State Space Modeling for 3D Hand Pose Estimation in Interactions
par: Zhou, Yifan, et autres
Publié: (2025) -
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
par: Ukai, Mahiro, et autres
Publié: (2025) -
Multi-Point Positional Insertion Tuning for Small Object Detection
par: Goto, Kanoko, et autres
Publié: (2024) -
Autoregressive Direct Preference Optimization
par: Oi, Masanari, et autres
Publié: (2026)