The Contribution of Knowledge in Visiolinguistic Learning: A Survey on Tasks and Challenges
Fuente:
arXiv
Guardado en:
| Autores principales: | Lymperaiou, Maria, Stamou, Giorgos |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Fine-Grained ImageNet Classification in the Wild
por: Lymperaiou, Maria, et al.
Publicado: (2023)
por: Lymperaiou, Maria, et al.
Publicado: (2023)
Counterfactual Edits for Generative Evaluation
por: Lymperaiou, Maria, et al.
Publicado: (2023)
por: Lymperaiou, Maria, et al.
Publicado: (2023)
Masked Generative Story Transformer with Character Guidance and Caption Augmentation
por: Papadimitriou, Christos, et al.
Publicado: (2024)
por: Papadimitriou, Christos, et al.
Publicado: (2024)
ARPA: A Novel Hybrid Model for Advancing Visual Word Disambiguation Using Large Language Models and Transformers
por: Papastavrou, Aristi, et al.
Publicado: (2024)
por: Papastavrou, Aristi, et al.
Publicado: (2024)
U-CECE: A Universal Multi-Resolution Framework for Conceptual Counterfactual Explanations
por: Dimitriou, Angeliki, et al.
Publicado: (2026)
por: Dimitriou, Angeliki, et al.
Publicado: (2026)
HalCECE: A Framework for Explainable Hallucination Detection through Conceptual Counterfactuals in Image Captioning
por: Lymperaiou, Maria, et al.
Publicado: (2025)
por: Lymperaiou, Maria, et al.
Publicado: (2025)
Structure Your Data: Towards Semantic Graph Counterfactuals
por: Dimitriou, Angeliki, et al.
Publicado: (2024)
por: Dimitriou, Angeliki, et al.
Publicado: (2024)
V-CECE: Visual Counterfactual Explanations via Conceptual Edits
por: Spanos, Nikolaos, et al.
Publicado: (2025)
por: Spanos, Nikolaos, et al.
Publicado: (2025)
Conceptual Contrastive Edits in Textual and Vision-Language Retrieval
por: Lymperaiou, Maria, et al.
Publicado: (2025)
por: Lymperaiou, Maria, et al.
Publicado: (2025)
Puzzle Solving using Reasoning of Large Language Models: A Survey
por: Giadikiaroglou, Panagiotis, et al.
Publicado: (2024)
por: Giadikiaroglou, Panagiotis, et al.
Publicado: (2024)
Language Models as Knowledge Bases for Visual Word Sense Disambiguation
por: Kritharoula, Anastasia, et al.
Publicado: (2023)
por: Kritharoula, Anastasia, et al.
Publicado: (2023)
AILS-NTUA at SemEval-2024 Task 9: Cracking Brain Teasers: Transformer Models for Lateral Thinking Puzzles
por: Panagiotopoulos, Ioannis, et al.
Publicado: (2024)
por: Panagiotopoulos, Ioannis, et al.
Publicado: (2024)
Automatic Generation of Fashion Images using Prompting in Generative Machine Learning Models
por: Argyrou, Georgia, et al.
Publicado: (2024)
por: Argyrou, Georgia, et al.
Publicado: (2024)
Prompt2Fashion: An automatically generated fashion dataset
por: Argyrou, Georgia, et al.
Publicado: (2024)
por: Argyrou, Georgia, et al.
Publicado: (2024)
Deep Ensemble Art Style Recognition
por: Menis-Mastromichalakis, Orfeas, et al.
Publicado: (2024)
por: Menis-Mastromichalakis, Orfeas, et al.
Publicado: (2024)
SCENIR: Visual Semantic Clarity through Unsupervised Scene Graph Retrieval
por: Chaidos, Nikolaos, et al.
Publicado: (2025)
por: Chaidos, Nikolaos, et al.
Publicado: (2025)
Designing Practical Models for Isolated Word Visual Speech Recognition
por: Panagos, Iason Ioannis, et al.
Publicado: (2025)
por: Panagos, Iason Ioannis, et al.
Publicado: (2025)
Leveraging Open Knowledge for Advancing Task Expertise in Large Language Models
por: Yang, Yuncheng, et al.
Publicado: (2024)
por: Yang, Yuncheng, et al.
Publicado: (2024)
Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling
por: Zou, Hongjian, et al.
Publicado: (2026)
por: Zou, Hongjian, et al.
Publicado: (2026)
Multimedia Generative Script Learning for Task Planning
por: Wang, Qingyun, et al.
Publicado: (2022)
por: Wang, Qingyun, et al.
Publicado: (2022)
KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding
por: Ma, Xinyu, et al.
Publicado: (2025)
por: Ma, Xinyu, et al.
Publicado: (2025)
Olympus: A Universal Task Router for Computer Vision Tasks
por: Lin, Yuanze, et al.
Publicado: (2024)
por: Lin, Yuanze, et al.
Publicado: (2024)
Grounding and Evaluation for Large Language Models: Practical Challenges and Lessons Learned (Survey)
por: Kenthapadi, Krishnaram, et al.
Publicado: (2024)
por: Kenthapadi, Krishnaram, et al.
Publicado: (2024)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
Overview of the NLPCC 2025 Shared Task 4: Multi-modal, Multilingual, and Multi-hop Medical Instructional Video Question Answering Challenge
por: Li, Bin, et al.
Publicado: (2025)
por: Li, Bin, et al.
Publicado: (2025)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
por: Li, Yanshu
Publicado: (2025)
por: Li, Yanshu
Publicado: (2025)
Large Multimodal Agents: A Survey
por: Xie, Junlin, et al.
Publicado: (2024)
por: Xie, Junlin, et al.
Publicado: (2024)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
por: Yu, Zhuoran, et al.
Publicado: (2025)
por: Yu, Zhuoran, et al.
Publicado: (2025)
Self Knowledge Re-expression: A Fully Local Method for Adapting LLMs to Tasks Using Intrinsic Knowledge
por: Wang, Mengyu, et al.
Publicado: (2026)
por: Wang, Mengyu, et al.
Publicado: (2026)
Lightweight Operations for Visual Speech Recognition
por: Panagos, Iason Ioannis, et al.
Publicado: (2025)
por: Panagos, Iason Ioannis, et al.
Publicado: (2025)
Knowledge Generation for Zero-shot Knowledge-based VQA
por: Cao, Rui, et al.
Publicado: (2024)
por: Cao, Rui, et al.
Publicado: (2024)
A Survey on Benchmarks of Multimodal Large Language Models
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
A Survey on Evaluation of Multimodal Large Language Models
por: Huang, Jiaxing, et al.
Publicado: (2024)
por: Huang, Jiaxing, et al.
Publicado: (2024)
A Survey on Agentic Multimodal Large Language Models
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
Knowledge-Based Counterfactual Queries for Visual Question Answering
por: Stoikou, Theodoti, et al.
Publicado: (2023)
por: Stoikou, Theodoti, et al.
Publicado: (2023)
Uncovering Knowledge Gaps in Radiology Report Generation Models through Knowledge Graphs
por: Zhang, Xiaoman, et al.
Publicado: (2024)
por: Zhang, Xiaoman, et al.
Publicado: (2024)
Vision-Language Models for Edge Networks: A Comprehensive Survey
por: Sharshar, Ahmed, et al.
Publicado: (2025)
por: Sharshar, Ahmed, et al.
Publicado: (2025)
MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization
por: Zhu, Chenyang, et al.
Publicado: (2026)
por: Zhu, Chenyang, et al.
Publicado: (2026)
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
por: Zhao, Yi, et al.
Publicado: (2024)
por: Zhao, Yi, et al.
Publicado: (2024)
Survey on Vision-Language-Action Models
por: Adilkhanov, Adilzhan, et al.
Publicado: (2025)
por: Adilkhanov, Adilzhan, et al.
Publicado: (2025)
Ejemplares similares
-
Fine-Grained ImageNet Classification in the Wild
por: Lymperaiou, Maria, et al.
Publicado: (2023) -
Counterfactual Edits for Generative Evaluation
por: Lymperaiou, Maria, et al.
Publicado: (2023) -
Masked Generative Story Transformer with Character Guidance and Caption Augmentation
por: Papadimitriou, Christos, et al.
Publicado: (2024) -
ARPA: A Novel Hybrid Model for Advancing Visual Word Disambiguation Using Large Language Models and Transformers
por: Papastavrou, Aristi, et al.
Publicado: (2024) -
U-CECE: A Universal Multi-Resolution Framework for Conceptual Counterfactual Explanations
por: Dimitriou, Angeliki, et al.
Publicado: (2026)