COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Hassan, Umair |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Socratic Planner: Self-QA-Based Zero-Shot Planning for Embodied Instruction Following
par: Shin, Suyeon, et autres
Publié: (2024)
par: Shin, Suyeon, et autres
Publié: (2024)
If you can describe it, they can see it: Cross-Modal Learning of Visual Concepts from Textual Descriptions
par: Barbano, Carlo Alberto, et autres
Publié: (2024)
par: Barbano, Carlo Alberto, et autres
Publié: (2024)
BAAF: Universal Transformation of One-Class Classifiers for Unsupervised Image Anomaly Detection
par: McIntosh, Declan, et autres
Publié: (2026)
par: McIntosh, Declan, et autres
Publié: (2026)
VLM@school -- Evaluation of AI image understanding on German middle school knowledge
par: Peinl, René, et autres
Publié: (2025)
par: Peinl, René, et autres
Publié: (2025)
How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study
par: Brusnicki, Roberto, et autres
Publié: (2026)
par: Brusnicki, Roberto, et autres
Publié: (2026)
Poisson Flow Consistency Training
par: Zhang, Anthony, et autres
Publié: (2025)
par: Zhang, Anthony, et autres
Publié: (2025)
CNNtention: Can CNNs do better with Attention?
par: Kapila, Nikhil, et autres
Publié: (2024)
par: Kapila, Nikhil, et autres
Publié: (2024)
Does CLIP perceive art the same way we do?
par: Asperti, Andrea, et autres
Publié: (2025)
par: Asperti, Andrea, et autres
Publié: (2025)
LEGAL-UQA: A Low-Resource Urdu-English Dataset for Legal Question Answering
par: Faisal, Faizan, et autres
Publié: (2024)
par: Faisal, Faizan, et autres
Publié: (2024)
Clarification as Supervision: Reinforcement Learning for Vision-Language Interfaces
par: Gkountouras, John, et autres
Publié: (2025)
par: Gkountouras, John, et autres
Publié: (2025)
Application of deep learning approaches for medieval historical documents transcription
par: Voloshchuk, Maksym, et autres
Publié: (2025)
par: Voloshchuk, Maksym, et autres
Publié: (2025)
Search Multilayer Perceptron-Based Fusion for Efficient and Accurate Siamese Tracking
par: Shen, Tianqi, et autres
Publié: (2026)
par: Shen, Tianqi, et autres
Publié: (2026)
MambaNetLK: Enhancing Colonoscopy Point Cloud Registration with Mamba
par: Jiang, Linzhe, et autres
Publié: (2025)
par: Jiang, Linzhe, et autres
Publié: (2025)
LRVS-Fashion: Extending Visual Search with Referring Instructions
par: Lepage, Simon, et autres
Publié: (2023)
par: Lepage, Simon, et autres
Publié: (2023)
Beyond RNNs: Benchmarking Attention-Based Image Captioning Models
par: Yanambakkam, Hemanth Teja, et autres
Publié: (2025)
par: Yanambakkam, Hemanth Teja, et autres
Publié: (2025)
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
par: Yim, Wen-wai, et autres
Publié: (2025)
par: Yim, Wen-wai, et autres
Publié: (2025)
A Survey on Vision-Language-Action Models for Embodied AI
par: Ma, Yueen, et autres
Publié: (2024)
par: Ma, Yueen, et autres
Publié: (2024)
Bridging the Language Gap: Enhancing Multilingual Prompt-Based Code Generation in LLMs via Zero-Shot Cross-Lingual Transfer
par: Li, Mingda, et autres
Publié: (2024)
par: Li, Mingda, et autres
Publié: (2024)
Multimodal Image Matching based on Frequency-domain Information of Local Energy Response
par: Yang, Meng, et autres
Publié: (2025)
par: Yang, Meng, et autres
Publié: (2025)
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
LayerAct: Advanced Activation Mechanism for Robust Inference of CNNs
par: Yoon, Kihyuk, et autres
Publié: (2023)
par: Yoon, Kihyuk, et autres
Publié: (2023)
HelloMeme: Integrating Spatial Knitting Attentions to Embed High-Level and Fidelity-Rich Conditions in Diffusion Models
par: Zhang, Shengkai, et autres
Publié: (2024)
par: Zhang, Shengkai, et autres
Publié: (2024)
Overcoming Catastrophic Forgetting in Federated Class-Incremental Learning via Federated Global Twin Generator
par: Nguyen, Thinh, et autres
Publié: (2024)
par: Nguyen, Thinh, et autres
Publié: (2024)
Revisiting Sampson Approximations for Geometric Estimation Problems
par: Rydell, Felix, et autres
Publié: (2024)
par: Rydell, Felix, et autres
Publié: (2024)
Nearest Neighbor Projection Removal Adversarial Training
par: Singh, Himanshu, et autres
Publié: (2025)
par: Singh, Himanshu, et autres
Publié: (2025)
Unsupervised Anomaly Detection Using Diffusion Trend Analysis for Display Inspection
par: Kim, Eunwoo, et autres
Publié: (2024)
par: Kim, Eunwoo, et autres
Publié: (2024)
ReasonPlan: Unified Scene Prediction and Decision Reasoning for Closed-loop Autonomous Driving
par: Liu, Xueyi, et autres
Publié: (2025)
par: Liu, Xueyi, et autres
Publié: (2025)
Empowering Image Recovery_ A Multi-Attention Approach
par: Wen, Juan, et autres
Publié: (2024)
par: Wen, Juan, et autres
Publié: (2024)
A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection
par: Malikussaid, et autres
Publié: (2026)
par: Malikussaid, et autres
Publié: (2026)
Benchmarking Vision Language Models on German Factual Data
par: Peinl, René, et autres
Publié: (2025)
par: Peinl, René, et autres
Publié: (2025)
Semi-automated extraction of research topics and trends from NCI funding in radiological sciences from 2000-2020
par: Nguyen, Mark, et autres
Publié: (2023)
par: Nguyen, Mark, et autres
Publié: (2023)
Archival Faces: Detection of Faces in Digitized Historical Documents
par: Vaško, Marek, et autres
Publié: (2025)
par: Vaško, Marek, et autres
Publié: (2025)
Generation of maximal snake polyominoes using a deep neural network
par: Gauthier, Benjamin, et autres
Publié: (2026)
par: Gauthier, Benjamin, et autres
Publié: (2026)
How many samples to label for an application given a foundation model? Chest X-ray classification study
par: Nechaev, Nikolay, et autres
Publié: (2025)
par: Nechaev, Nikolay, et autres
Publié: (2025)
JVLGS: Joint Vision-Language Gas Leak Segmentation
par: Zhao, Xinlong, et autres
Publié: (2025)
par: Zhao, Xinlong, et autres
Publié: (2025)
VALE: A Multimodal Visual and Language Explanation Framework for Image Classifiers using eXplainable AI and Language Models
par: Natarajan, Purushothaman, et autres
Publié: (2024)
par: Natarajan, Purushothaman, et autres
Publié: (2024)
FastGS: Training 3D Gaussian Splatting in 100 Seconds
par: Ren, Shiwei, et autres
Publié: (2025)
par: Ren, Shiwei, et autres
Publié: (2025)
SEGS-SLAM: Structure-enhanced 3D Gaussian Splatting SLAM with Appearance Embedding
par: Wen, Tianci, et autres
Publié: (2025)
par: Wen, Tianci, et autres
Publié: (2025)
A large-scale, physically-based synthetic dataset for satellite pose estimation
par: Velkei, Szabolcs, et autres
Publié: (2025)
par: Velkei, Szabolcs, et autres
Publié: (2025)
QCFace: Image Quality Control for boosting Face Representation & Recognition
par: Doan-Ngo, Duc-Phuong, et autres
Publié: (2025)
par: Doan-Ngo, Duc-Phuong, et autres
Publié: (2025)
Documents similaires
-
Socratic Planner: Self-QA-Based Zero-Shot Planning for Embodied Instruction Following
par: Shin, Suyeon, et autres
Publié: (2024) -
If you can describe it, they can see it: Cross-Modal Learning of Visual Concepts from Textual Descriptions
par: Barbano, Carlo Alberto, et autres
Publié: (2024) -
BAAF: Universal Transformation of One-Class Classifiers for Unsupervised Image Anomaly Detection
par: McIntosh, Declan, et autres
Publié: (2026) -
VLM@school -- Evaluation of AI image understanding on German middle school knowledge
par: Peinl, René, et autres
Publié: (2025) -
How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study
par: Brusnicki, Roberto, et autres
Publié: (2026)