Multi-modal user interface control detection using cross-attention
Fuente:
arXiv
Salvato in:
| Autori principali: | Moradi, Milad, Yan, Ke, Colwell, David, Samwald, Matthias, Asgari, Rhona |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Model-agnostic explainable artificial intelligence for object detection in image data
di: Moradi, Milad, et al.
Pubblicazione: (2023)
di: Moradi, Milad, et al.
Pubblicazione: (2023)
A critical review of methods and challenges in large language models
di: Moradi, Milad, et al.
Pubblicazione: (2024)
di: Moradi, Milad, et al.
Pubblicazione: (2024)
Artificial intelligence for context-aware visual change detection in software test automation
di: Moradi, Milad, et al.
Pubblicazione: (2024)
di: Moradi, Milad, et al.
Pubblicazione: (2024)
An empirical study of LoRA-based fine-tuning of large language models for automated test case generation
di: Moradi, Milad, et al.
Pubblicazione: (2026)
di: Moradi, Milad, et al.
Pubblicazione: (2026)
FedGIN: Federated Learning with Dynamic Global Intensity Non-linear Augmentation for Organ Segmentation using Multi-modal Images
di: Nagaraju, Sachin Dudda, et al.
Pubblicazione: (2025)
di: Nagaraju, Sachin Dudda, et al.
Pubblicazione: (2025)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
VLA-Mark: A cross modal watermark for large vision-language alignment model
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
Phantom: Subject-consistent video generation via cross-modal alignment
di: Liu, Lijie, et al.
Pubblicazione: (2025)
di: Liu, Lijie, et al.
Pubblicazione: (2025)
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
di: Tao, Haoyi, et al.
Pubblicazione: (2026)
di: Tao, Haoyi, et al.
Pubblicazione: (2026)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
Efficient endometrial carcinoma screening via cross-modal synthesis and gradient distillation
di: Shan, Dongjing, et al.
Pubblicazione: (2026)
di: Shan, Dongjing, et al.
Pubblicazione: (2026)
Relation Learning and Aggregate-attention for Multi-person Motion Prediction
di: Qu, Kehua, et al.
Pubblicazione: (2024)
di: Qu, Kehua, et al.
Pubblicazione: (2024)
Multi-modality Anomaly Segmentation on the Road
di: Gao, Heng, et al.
Pubblicazione: (2025)
di: Gao, Heng, et al.
Pubblicazione: (2025)
Awesome Multi-modal Object Tracking
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
MulCPred: Learning Multi-modal Concepts for Explainable Pedestrian Action Prediction
di: Feng, Yan, et al.
Pubblicazione: (2024)
di: Feng, Yan, et al.
Pubblicazione: (2024)
DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces
di: Khan, Mohammad Sadil, et al.
Pubblicazione: (2026)
di: Khan, Mohammad Sadil, et al.
Pubblicazione: (2026)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
di: Chen, Haokun, et al.
Pubblicazione: (2025)
di: Chen, Haokun, et al.
Pubblicazione: (2025)
Scene-aware SAR ship detection guided by unsupervised sea-land segmentation
di: Ke, Han, et al.
Pubblicazione: (2025)
di: Ke, Han, et al.
Pubblicazione: (2025)
Fine-grained Action Analysis: A Multi-modality and Multi-task Dataset of Figure Skating
di: Liu, Sheng-Lan, et al.
Pubblicazione: (2023)
di: Liu, Sheng-Lan, et al.
Pubblicazione: (2023)
Externally Validated Multi-Task Learning via Consistency Regularization Using Differentiable BI-RADS Features for Breast Ultrasound Tumor Segmentation
di: Zhang, Jingru, et al.
Pubblicazione: (2025)
di: Zhang, Jingru, et al.
Pubblicazione: (2025)
Weakly supervised multimodal segmentation of acoustic borehole images with depth-aware cross-attention
di: Silva, Jose Luis Lima de Jesus
Pubblicazione: (2026)
di: Silva, Jose Luis Lima de Jesus
Pubblicazione: (2026)
TrajFlow: Multi-modal Motion Prediction via Flow Matching
di: Yan, Qi, et al.
Pubblicazione: (2025)
di: Yan, Qi, et al.
Pubblicazione: (2025)
KAN-RCBEVDepth: A multi-modal fusion algorithm in object detection for autonomous driving
di: Lai, Zhihao, et al.
Pubblicazione: (2024)
di: Lai, Zhihao, et al.
Pubblicazione: (2024)
LTOS: Layout-controllable Text-Object Synthesis via Adaptive Cross-attention Fusions
di: Zhao, Xiaoran, et al.
Pubblicazione: (2024)
di: Zhao, Xiaoran, et al.
Pubblicazione: (2024)
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
CognitionCapturerPro: Towards High-Fidelity Visual Decoding from EEG/MEG via Multi-modal Information and Asymmetric Alignment
di: Zhang, Kaifan, et al.
Pubblicazione: (2026)
di: Zhang, Kaifan, et al.
Pubblicazione: (2026)
Multi-modal Deepfake Detection and Localization with FPN-Transformer
di: Zheng, Chende, et al.
Pubblicazione: (2025)
di: Zheng, Chende, et al.
Pubblicazione: (2025)
Robust Domain Generalization for Multi-modal Object Recognition
di: Qiao, Yuxin, et al.
Pubblicazione: (2024)
di: Qiao, Yuxin, et al.
Pubblicazione: (2024)
Towards Billion-scale Multi-modal Biometric Search
di: Koner, Arka, et al.
Pubblicazione: (2026)
di: Koner, Arka, et al.
Pubblicazione: (2026)
Adaptation of Multi-modal Representation Models for Multi-task Surgical Computer Vision
di: Walimbe, Soham, et al.
Pubblicazione: (2025)
di: Walimbe, Soham, et al.
Pubblicazione: (2025)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
di: Liao, Pan, et al.
Pubblicazione: (2026)
di: Liao, Pan, et al.
Pubblicazione: (2026)
Self-supervised cross-modality learning for uncertainty-aware object detection and recognition in applications which lack pre-labelled training data
di: Mehboob, Irum, et al.
Pubblicazione: (2024)
di: Mehboob, Irum, et al.
Pubblicazione: (2024)
QUEST: A robust attention formulation using query-modulated spherical attention
di: Govindarajan, Hariprasath, et al.
Pubblicazione: (2026)
di: Govindarajan, Hariprasath, et al.
Pubblicazione: (2026)
Multi-modal Auto-regressive Modeling via Visual Words
di: Peng, Tianshuo, et al.
Pubblicazione: (2024)
di: Peng, Tianshuo, et al.
Pubblicazione: (2024)
EMMA: Empowering Multi-modal Mamba with Structural and Hierarchical Alignment
di: Xing, Yifei, et al.
Pubblicazione: (2024)
di: Xing, Yifei, et al.
Pubblicazione: (2024)
Can Multi-modal (reasoning) LLMs work as deepfake detectors?
di: Ren, Simiao, et al.
Pubblicazione: (2025)
di: Ren, Simiao, et al.
Pubblicazione: (2025)
MGHanD: Multi-modal Guidance for authentic Hand Diffusion
di: Eum, Taehyeon, et al.
Pubblicazione: (2025)
di: Eum, Taehyeon, et al.
Pubblicazione: (2025)
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
Exploring Efficient Foundational Multi-modal Models for Video Summarization
di: Samel, Karan, et al.
Pubblicazione: (2024)
di: Samel, Karan, et al.
Pubblicazione: (2024)
GCA-ResUNet:Image segmentation in medical images using grouped coordinate attention
di: Ding, Jun, et al.
Pubblicazione: (2025)
di: Ding, Jun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Model-agnostic explainable artificial intelligence for object detection in image data
di: Moradi, Milad, et al.
Pubblicazione: (2023) -
A critical review of methods and challenges in large language models
di: Moradi, Milad, et al.
Pubblicazione: (2024) -
Artificial intelligence for context-aware visual change detection in software test automation
di: Moradi, Milad, et al.
Pubblicazione: (2024) -
An empirical study of LoRA-based fine-tuning of large language models for automated test case generation
di: Moradi, Milad, et al.
Pubblicazione: (2026) -
FedGIN: Federated Learning with Dynamic Global Intensity Non-linear Augmentation for Organ Segmentation using Multi-modal Images
di: Nagaraju, Sachin Dudda, et al.
Pubblicazione: (2025)