Beyond RNNs: Benchmarking Attention-Based Image Captioning Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yanambakkam, Hemanth Teja, Chinthala, Rahul |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RCI: A Score for Evaluating Global and Local Reasoning in Multimodal Benchmarks
par: Agarwal, Amit, et autres
Publié: (2025)
par: Agarwal, Amit, et autres
Publié: (2025)
VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors
par: Lyu, Wenbo, et autres
Publié: (2025)
par: Lyu, Wenbo, et autres
Publié: (2025)
PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
par: Yang, Baoyao, et autres
Publié: (2025)
par: Yang, Baoyao, et autres
Publié: (2025)
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
par: Yim, Wen-wai, et autres
Publié: (2025)
par: Yim, Wen-wai, et autres
Publié: (2025)
From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation
par: Chen, Jingkun, et autres
Publié: (2025)
par: Chen, Jingkun, et autres
Publié: (2025)
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning
par: Patel, Urjitkumar, et autres
Publié: (2025)
par: Patel, Urjitkumar, et autres
Publié: (2025)
3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model
par: Ko, Hyun-kyu, et autres
Publié: (2026)
par: Ko, Hyun-kyu, et autres
Publié: (2026)
Smelly, dense, and spreaded: The Object Detection for Olfactory References (ODOR) dataset
par: Zinnen, Mathias, et autres
Publié: (2025)
par: Zinnen, Mathias, et autres
Publié: (2025)
Hierarchical Spatial Algorithms for High-Resolution Image Quantization and Feature Extraction
par: Mohammad, Noor Islam S.
Publié: (2025)
par: Mohammad, Noor Islam S.
Publié: (2025)
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025)
par: Cai, Weibin, et autres
Publié: (2025)
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
par: Viveiros, André G., et autres
Publié: (2025)
par: Viveiros, André G., et autres
Publié: (2025)
VDPP: Video Depth Post-Processing for Speed and Scalability
par: Yoon, Daewon, et autres
Publié: (2026)
par: Yoon, Daewon, et autres
Publié: (2026)
VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models
par: Su, Yuetong, et autres
Publié: (2025)
par: Su, Yuetong, et autres
Publié: (2025)
DSER: Spectral Epipolar Representation for Efficient Light Field Depth Estimation
par: Mohammad, Noor Islam S., et autres
Publié: (2025)
par: Mohammad, Noor Islam S., et autres
Publié: (2025)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
par: Fu, Tianyu, et autres
Publié: (2024)
par: Fu, Tianyu, et autres
Publié: (2024)
The MSR-Video to Text Dataset with Clean Annotations
par: Chen, Haoran, et autres
Publié: (2021)
par: Chen, Haoran, et autres
Publié: (2021)
Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025)
par: Raoufi, Behnam, et autres
Publié: (2025)
Context-Dependent Affordance Computation in Vision-Language Models
par: Farzulla, Murad
Publié: (2026)
par: Farzulla, Murad
Publié: (2026)
ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents
par: Huo, Dongjie, et autres
Publié: (2026)
par: Huo, Dongjie, et autres
Publié: (2026)
OpenFusion++: An Open-vocabulary Real-time Scene Understanding System
par: Jin, Xiaofeng, et autres
Publié: (2025)
par: Jin, Xiaofeng, et autres
Publié: (2025)
Do Generative Metrics Predict YOLO Performance? An Evaluation Across Models, Augmentation Ratios, and Dataset Complexity
par: Marian, Vasile, et autres
Publié: (2026)
par: Marian, Vasile, et autres
Publié: (2026)
Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images
par: Chen, Yuangong, et autres
Publié: (2026)
par: Chen, Yuangong, et autres
Publié: (2026)
Point, Detect, Count: Multi-Task Medical Image Understanding with Instruction-Tuned Vision-Language Models
par: Gautam, Sushant, et autres
Publié: (2025)
par: Gautam, Sushant, et autres
Publié: (2025)
Polarization-Based Eye Tracking with Personalized Siamese Architectures
par: Kalkanli, Beyza, et autres
Publié: (2026)
par: Kalkanli, Beyza, et autres
Publié: (2026)
MEGA-GUI: Multi-stage Enhanced Grounding Agents for GUI Elements
par: Kwak, SeokJoo, et autres
Publié: (2025)
par: Kwak, SeokJoo, et autres
Publié: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology
par: Kim, Soyeon, et autres
Publié: (2026)
par: Kim, Soyeon, et autres
Publié: (2026)
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
Image-based Facial Rig Inversion
par: Yang, Tianxiang, et autres
Publié: (2025)
par: Yang, Tianxiang, et autres
Publié: (2025)
Semantic2Graph: Graph-based Multi-modal Feature Fusion for Action Segmentation in Videos
par: Zhang, Junbin, et autres
Publié: (2022)
par: Zhang, Junbin, et autres
Publié: (2022)
Predictive Modeling of Maritime Radar Data Using Transformer Architecture
par: Qesaraku, Bjorna, et autres
Publié: (2025)
par: Qesaraku, Bjorna, et autres
Publié: (2025)
Dual-sensing driving detection model
par: K, Leon C. C., et autres
Publié: (2025)
par: K, Leon C. C., et autres
Publié: (2025)
Sat-JEPA-Diff: Bridging Self-Supervised Learning and Generative Diffusion for Remote Sensing
par: Komurcu, Kursat, et autres
Publié: (2026)
par: Komurcu, Kursat, et autres
Publié: (2026)
ShapBPT: Image Feature Attributions Using Data-Aware Binary Partition Trees
par: Rashid, Muhammad, et autres
Publié: (2026)
par: Rashid, Muhammad, et autres
Publié: (2026)
Can Local Vision-Language Models improve Activity Recognition over Vision Transformers? -- Case Study on Newborn Resuscitation
par: Guerriero, Enrico, et autres
Publié: (2026)
par: Guerriero, Enrico, et autres
Publié: (2026)
Short-Window Sliding Learning for Real-Time Violence Detection via LLM-based Auto-Labeling
par: Jung, Seoik, et autres
Publié: (2025)
par: Jung, Seoik, et autres
Publié: (2025)
HEDGE: Hallucination Estimation via Dense Geometric Entropy for VQA with Vision-Language Models
par: Gautam, Sushant, et autres
Publié: (2025)
par: Gautam, Sushant, et autres
Publié: (2025)
MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation
par: Qi, Dekang, et autres
Publié: (2026)
par: Qi, Dekang, et autres
Publié: (2026)
Documents similaires
-
RCI: A Score for Evaluating Global and Local Reasoning in Multimodal Benchmarks
par: Agarwal, Amit, et autres
Publié: (2025) -
VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors
par: Lyu, Wenbo, et autres
Publié: (2025) -
PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025) -
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
par: Yang, Baoyao, et autres
Publié: (2025) -
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
par: Yim, Wen-wai, et autres
Publié: (2025)