WordVIS: A Color Worth A Thousand Words
Fuente:
arXiv
Salvato in:
| Autori principali: | Khan, Umar, Saifullah, Agne, Stefan, Dengel, Andreas, Ahmed, Sheraz |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DocXplain: A Novel Model-Agnostic Explainability Method for Document Image Classification
di: Saifullah, Saifullah, et al.
Pubblicazione: (2024)
di: Saifullah, Saifullah, et al.
Pubblicazione: (2024)
DocVCE: Diffusion-based Visual Counterfactual Explanations for Document Image Classification
di: Saifullah, Saifullah, et al.
Pubblicazione: (2025)
di: Saifullah, Saifullah, et al.
Pubblicazione: (2025)
Privacy Meets Explainability: A Comprehensive Impact Benchmark
di: Saifullah, Saifullah, et al.
Pubblicazione: (2022)
di: Saifullah, Saifullah, et al.
Pubblicazione: (2022)
Latent Diffusion for Guided Document Table Generation
di: Hamdani, Syed Jawwad Haider, et al.
Pubblicazione: (2024)
di: Hamdani, Syed Jawwad Haider, et al.
Pubblicazione: (2024)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
One Image is Worth a Thousand Words: A Usability Preservable Text-Image Collaborative Erasing Framework
di: Li, Feiran, et al.
Pubblicazione: (2025)
di: Li, Feiran, et al.
Pubblicazione: (2025)
Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity
di: Jung, Jaeyoon, et al.
Pubblicazione: (2026)
di: Jung, Jaeyoon, et al.
Pubblicazione: (2026)
Vript: A Video Is Worth Thousands of Words
di: Yang, Dongjie, et al.
Pubblicazione: (2024)
di: Yang, Dongjie, et al.
Pubblicazione: (2024)
A Video Is Not Worth a Thousand Words
di: Pollard, Sam, et al.
Pubblicazione: (2025)
di: Pollard, Sam, et al.
Pubblicazione: (2025)
A Picture is Worth a Thousand Words? An Empirical Study of Aggregation Strategies for Visual Financial Document Retrieval
di: Lim, Ho Hung, et al.
Pubblicazione: (2026)
di: Lim, Ho Hung, et al.
Pubblicazione: (2026)
A Low-Resolution Image is Worth 1x1 Words: Enabling Fine Image Super-Resolution with Transformers and TaylorShift
di: Nagaraju, Sanath Budakegowdanadoddi, et al.
Pubblicazione: (2024)
di: Nagaraju, Sanath Budakegowdanadoddi, et al.
Pubblicazione: (2024)
A Thousand Words or An Image: Studying the Influence of Persona Modality in Multimodal LLMs
di: Broomfield, Julius, et al.
Pubblicazione: (2025)
di: Broomfield, Julius, et al.
Pubblicazione: (2025)
An Image Is Worth Ten Thousand Words: Verbose-Text Induction Attacks on VLMs
di: Luo, Zhi, et al.
Pubblicazione: (2025)
di: Luo, Zhi, et al.
Pubblicazione: (2025)
A Permuted Autoregressive Approach to Word-Level Recognition for Urdu Digital Text
di: Mustafa, Ahmed, et al.
Pubblicazione: (2024)
di: Mustafa, Ahmed, et al.
Pubblicazione: (2024)
Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation
di: Waseem, Faraz, et al.
Pubblicazione: (2024)
di: Waseem, Faraz, et al.
Pubblicazione: (2024)
Channel Vision Transformers: An Image Is Worth 1 x 16 x 16 Words
di: Bao, Yujia, et al.
Pubblicazione: (2023)
di: Bao, Yujia, et al.
Pubblicazione: (2023)
Are a Thousand Words Better Than a Single Picture? Beyond Images -- A Framework for Multi-Modal Knowledge Graph Dataset Enrichment
di: Zhang, Pengyu, et al.
Pubblicazione: (2026)
di: Zhang, Pengyu, et al.
Pubblicazione: (2026)
Malware Detection in Docker Containers: An Image is Worth a Thousand Logs
di: Nousias, Akis, et al.
Pubblicazione: (2025)
di: Nousias, Akis, et al.
Pubblicazione: (2025)
Not Every Image is Worth a Thousand Words: Quantifying Originality in Stable Diffusion
di: Haviv, Adi, et al.
Pubblicazione: (2024)
di: Haviv, Adi, et al.
Pubblicazione: (2024)
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
di: Tang, Raphael, et al.
Pubblicazione: (2024)
di: Tang, Raphael, et al.
Pubblicazione: (2024)
Visual Words Meet BM25: Sparse Auto-Encoder Visual Word Scoring for Image Retrieval
di: Han, Donghoon, et al.
Pubblicazione: (2026)
di: Han, Donghoon, et al.
Pubblicazione: (2026)
FOLC-Net: A Federated-Optimized Lightweight Architecture for Enhanced MRI Disease Diagnosis across Axial, Coronal, and Sagittal Views
di: Khan, Saif Ur Rehman, et al.
Pubblicazione: (2025)
di: Khan, Saif Ur Rehman, et al.
Pubblicazione: (2025)
Moondream Segmentation: From Words to Masks
di: Reid, Ethan
Pubblicazione: (2026)
di: Reid, Ethan
Pubblicazione: (2026)
A Picture is Worth a Thousand Prompts? Efficacy of Iterative Human-Driven Prompt Refinement in Image Regeneration Tasks
di: Trinh, Khoi, et al.
Pubblicazione: (2025)
di: Trinh, Khoi, et al.
Pubblicazione: (2025)
An Image is Worth Multiple Words: Discovering Object Level Concepts using Multi-Concept Prompt Learning
di: Jin, Chen, et al.
Pubblicazione: (2023)
di: Jin, Chen, et al.
Pubblicazione: (2023)
Ukrainian Visual Word Sense Disambiguation Benchmark
di: Laba, Yurii, et al.
Pubblicazione: (2026)
di: Laba, Yurii, et al.
Pubblicazione: (2026)
Dynamic Weight Adjustment for Knowledge Distillation: Leveraging Vision Transformer for High-Accuracy Lung Cancer Detection and Real-Time Deployment
di: Khan, Saif Ur Rehman, et al.
Pubblicazione: (2025)
di: Khan, Saif Ur Rehman, et al.
Pubblicazione: (2025)
The Scene Language: Representing Scenes with Programs, Words, and Embeddings
di: Zhang, Yunzhi, et al.
Pubblicazione: (2024)
di: Zhang, Yunzhi, et al.
Pubblicazione: (2024)
Align Where the Words Look: Cross-Attention-Guided Patch Alignment with Contrastive and Transport Regularization for Bengali Captioning
di: Anonto, Riad Ahmed, et al.
Pubblicazione: (2025)
di: Anonto, Riad Ahmed, et al.
Pubblicazione: (2025)
VATr++: Choose Your Words Wisely for Handwritten Text Generation
di: Vanherle, Bram, et al.
Pubblicazione: (2024)
di: Vanherle, Bram, et al.
Pubblicazione: (2024)
Multi-modal Auto-regressive Modeling via Visual Words
di: Peng, Tianshuo, et al.
Pubblicazione: (2024)
di: Peng, Tianshuo, et al.
Pubblicazione: (2024)
Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models
di: Han, Tianyang, et al.
Pubblicazione: (2025)
di: Han, Tianyang, et al.
Pubblicazione: (2025)
Missing Data as Augmentation in the Earth Observation Domain: A Multi-View Learning Approach
di: Mena, Francisco, et al.
Pubblicazione: (2025)
di: Mena, Francisco, et al.
Pubblicazione: (2025)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning
di: Najar, Ali, et al.
Pubblicazione: (2026)
di: Najar, Ali, et al.
Pubblicazione: (2026)
A More Word-like Image Tokenization for MLLMs
di: Lee, Hyun, et al.
Pubblicazione: (2026)
di: Lee, Hyun, et al.
Pubblicazione: (2026)
Everything Can Be Described in Words: A Simple Unified Multi-Modal Framework with Semantic and Temporal Alignment
di: Bi, Xiaowei, et al.
Pubblicazione: (2025)
di: Bi, Xiaowei, et al.
Pubblicazione: (2025)
Do Blind Spots Matter for Word-Referent Mapping? A Computational Study with Infant Egocentric Video
di: Shi, Zekai, et al.
Pubblicazione: (2025)
di: Shi, Zekai, et al.
Pubblicazione: (2025)
Beyond Words: Multimodal LLM Knows When to Speak
di: Liao, Zikai, et al.
Pubblicazione: (2025)
di: Liao, Zikai, et al.
Pubblicazione: (2025)
When Words Smile: Generating Diverse Emotional Facial Expressions from Text
di: Xu, Haidong, et al.
Pubblicazione: (2024)
di: Xu, Haidong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DocXplain: A Novel Model-Agnostic Explainability Method for Document Image Classification
di: Saifullah, Saifullah, et al.
Pubblicazione: (2024) -
DocVCE: Diffusion-based Visual Counterfactual Explanations for Document Image Classification
di: Saifullah, Saifullah, et al.
Pubblicazione: (2025) -
Privacy Meets Explainability: A Comprehensive Impact Benchmark
di: Saifullah, Saifullah, et al.
Pubblicazione: (2022) -
Latent Diffusion for Guided Document Table Generation
di: Hamdani, Syed Jawwad Haider, et al.
Pubblicazione: (2024) -
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
di: Wang, Jiayu, et al.
Pubblicazione: (2024)