VCRScore: Image captioning metric based on V\&L Transformers, CLIP, and precision-recall
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ruiz, Guillermo, Ramírez, Tania, Moctezuma, Daniela |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RoNFA: Robust Neural Field-based Approach for Few-Shot Image Classification with Noisy Labels
par: Xiang, Nan, et autres
Publié: (2025)
par: Xiang, Nan, et autres
Publié: (2025)
PairHuman: A High-Fidelity Photographic Dataset for Customized Dual-Person Generation
par: Pan, Ting, et autres
Publié: (2025)
par: Pan, Ting, et autres
Publié: (2025)
VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena
par: Parcalabescu, Letitia, et autres
Publié: (2021)
par: Parcalabescu, Letitia, et autres
Publié: (2021)
MM-SHAP: A Performance-agnostic Metric for Measuring Multimodal Contributions in Vision and Language Models & Tasks
par: Parcalabescu, Letitia, et autres
Publié: (2022)
par: Parcalabescu, Letitia, et autres
Publié: (2022)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
par: Xie, Zeyu, et autres
Publié: (2026)
par: Xie, Zeyu, et autres
Publié: (2026)
When Audio Generators Become Good Listeners: Generative Features for Understanding Tasks
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
Do Vision & Language Decoders use Images and Text equally? How Self-consistent are their Explanations?
par: Parcalabescu, Letitia, et autres
Publié: (2024)
par: Parcalabescu, Letitia, et autres
Publié: (2024)
On Measuring Faithfulness or Self-consistency of Natural Language Explanations
par: Parcalabescu, Letitia, et autres
Publié: (2023)
par: Parcalabescu, Letitia, et autres
Publié: (2023)
Toward Storage-Aware Learning with Compressed Data An Empirical Exploratory Study on JPEG
par: Lee, Kichang, et autres
Publié: (2025)
par: Lee, Kichang, et autres
Publié: (2025)
Verifiable Dropout: Turning Randomness into a Verifiable Claim
par: Lee, Kichang, et autres
Publié: (2025)
par: Lee, Kichang, et autres
Publié: (2025)
Distributional Drift Adaptation with Temporal Conditional Variational Autoencoder for Multivariate Time Series Forecasting
par: He, Hui, et autres
Publié: (2022)
par: He, Hui, et autres
Publié: (2022)
STAR: Speech-to-Audio Generation via Representation Learning
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Contemporary Agent Technology: LLM-Driven Advancements vs Classic Multi-Agent Systems
par: Bădică, Costin, et autres
Publié: (2025)
par: Bădică, Costin, et autres
Publié: (2025)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
par: Zheng, Zihao, et autres
Publié: (2025)
par: Zheng, Zihao, et autres
Publié: (2025)
FakeSound: Deepfake General Audio Detection
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Dance of the ADS: Orchestrating Failures through Historically-Informed Scenario Fuzzing
par: Wang, Tong, et autres
Publié: (2024)
par: Wang, Tong, et autres
Publié: (2024)
Methods to integrate multinormals and compute classification measures
par: Das, Abhranil, et autres
Publié: (2020)
par: Das, Abhranil, et autres
Publié: (2020)
Robust Multivariate Time Series Forecasting against Intra- and Inter-Series Transitional Shift
par: He, Hui, et autres
Publié: (2024)
par: He, Hui, et autres
Publié: (2024)
AI-Driven Innovations in Modern Cloud Computing
par: Kumar, Animesh
Publié: (2024)
par: Kumar, Animesh
Publié: (2024)
Enabling Trustworthy Federated Learning in Industrial IoT: Bridging the Gap Between Interpretability and Robustness
par: Jagatheesaperumal, Senthil Kumar, et autres
Publié: (2024)
par: Jagatheesaperumal, Senthil Kumar, et autres
Publié: (2024)
Redefining Finance: The Influence of Artificial Intelligence (AI) and Machine Learning (ML)
par: Kumar, Animesh
Publié: (2024)
par: Kumar, Animesh
Publié: (2024)
LVP-CLIP:Revisiting CLIP for Continual Learning with Label Vector Pool
par: Ma, Yue, et autres
Publié: (2024)
par: Ma, Yue, et autres
Publié: (2024)
Multimodal sensor fusion in the latent representation space
par: Piechocki, Robert J., et autres
Publié: (2022)
par: Piechocki, Robert J., et autres
Publié: (2022)
Automated Quality Control System for Canned Tuna Production using Artificial Vision
par: Vera, Sendey, et autres
Publié: (2024)
par: Vera, Sendey, et autres
Publié: (2024)
Simple Prompt Injection Attacks Can Leak Personal Data Observed by LLM Agents During Task Execution
par: Alizadeh, Meysam, et autres
Publié: (2025)
par: Alizadeh, Meysam, et autres
Publié: (2025)
Dynamic Cooperative Strategies in Search Engine Advertising Market: With and Without Retail Competition
par: Li, Huiran, et autres
Publié: (2025)
par: Li, Huiran, et autres
Publié: (2025)
Expressivity of Representation Learning on Continuous-Time Dynamic Graphs: An Information-Flow Centric Review
par: Ennadir, Sofiane, et autres
Publié: (2024)
par: Ennadir, Sofiane, et autres
Publié: (2024)
LangDA: Building Context-Awareness via Language for Domain Adaptive Semantic Segmentation
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Superior Scoring Rules for Probabilistic Evaluation of Single-Label Multi-Class Classification Tasks
par: Ahmadian, Rouhollah, et autres
Publié: (2024)
par: Ahmadian, Rouhollah, et autres
Publié: (2024)
Ethical Artificial Intelligence Principles and Guidelines for the Governance and Utilization of Highly Advanced Large Language Models
par: Hossain, Soaad, et autres
Publié: (2023)
par: Hossain, Soaad, et autres
Publié: (2023)
Motion-Based Sign Language Video Summarization using Curvature and Torsion
par: Sartinas, Evangelos G., et autres
Publié: (2023)
par: Sartinas, Evangelos G., et autres
Publié: (2023)
Fruit Deformity Classification through Single-Input and Multi-Input Architectures based on CNN Models using Real and Synthetic Images
par: Beltran, Tommy D., et autres
Publié: (2024)
par: Beltran, Tommy D., et autres
Publié: (2024)
Model-Based Soft Maximization of Suitable Metrics of Long-Term Human Power
par: Heitzig, Jobst, et autres
Publié: (2025)
par: Heitzig, Jobst, et autres
Publié: (2025)
Exploring ChatGPT and its Impact on Society
par: Haque, Md. Asraful, et autres
Publié: (2024)
par: Haque, Md. Asraful, et autres
Publié: (2024)
ViMo: Generating Motions from Casual Videos
par: Qiu, Liangdong, et autres
Publié: (2024)
par: Qiu, Liangdong, et autres
Publié: (2024)
Conversion rate prediction in online advertising: modeling techniques, performance evaluation and future directions
par: Xue, Tao, et autres
Publié: (2025)
par: Xue, Tao, et autres
Publié: (2025)
Documents similaires
-
RoNFA: Robust Neural Field-based Approach for Few-Shot Image Classification with Noisy Labels
par: Xiang, Nan, et autres
Publié: (2025) -
PairHuman: A High-Fidelity Photographic Dataset for Customized Dual-Person Generation
par: Pan, Ting, et autres
Publié: (2025) -
VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena
par: Parcalabescu, Letitia, et autres
Publié: (2021) -
MM-SHAP: A Performance-agnostic Metric for Measuring Multimodal Contributions in Vision and Language Models & Tasks
par: Parcalabescu, Letitia, et autres
Publié: (2022) -
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
par: Xie, Zeyu, et autres
Publié: (2026)