A Lightweight Vision-Language Fusion Framework for Predicting App Ratings from User Interfaces and Metadata
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sultana, Azrin, Ahmed, Firoz |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Explicit Grammar Semantic Feature Fusion for Robust Text Classification
par: Sultana, Azrin, et autres
Publié: (2026)
par: Sultana, Azrin, et autres
Publié: (2026)
ColorFoil: Investigating Color Blindness in Large Vision and Language Models
par: Samin, Ahnaf Mozib, et autres
Publié: (2024)
par: Samin, Ahnaf Mozib, et autres
Publié: (2024)
AquaFusionNet: Lightweight VisionSensor Fusion Framework for Real-Time Pathogen Detection and Water Quality Anomaly Prediction on Edge Devices
par: Kristanto, Sepyan Purnama, et autres
Publié: (2025)
par: Kristanto, Sepyan Purnama, et autres
Publié: (2025)
ControlFusion: A Controllable Image Fusion Framework with Language-Vision Degradation Prompts
par: Tang, Linfeng, et autres
Publié: (2025)
par: Tang, Linfeng, et autres
Publié: (2025)
Vision-Language Models for Automated Chest X-ray Interpretation: Leveraging ViT and GPT-2
par: Islam, Md. Rakibul, et autres
Publié: (2025)
par: Islam, Md. Rakibul, et autres
Publié: (2025)
A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering
par: Hossain, Md. Zahid, et autres
Publié: (2026)
par: Hossain, Md. Zahid, et autres
Publié: (2026)
Vision-Based Robust Lane Detection and Tracking under Different Challenging Environmental Conditions
par: Sultana, Samia, et autres
Publié: (2022)
par: Sultana, Samia, et autres
Publié: (2022)
Lightweight Spatial Embedding for Vision-based 3D Occupancy Prediction
par: Zhang, Jinqing, et autres
Publié: (2024)
par: Zhang, Jinqing, et autres
Publié: (2024)
Computer User Interface Understanding. A New Dataset and a Learning Framework
par: Muñoz, Andrés, et autres
Publié: (2024)
par: Muñoz, Andrés, et autres
Publié: (2024)
CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design
par: Jeong, Daeheon, et autres
Publié: (2025)
par: Jeong, Daeheon, et autres
Publié: (2025)
T-Gated Adapter: A Lightweight Temporal Adapter for Vision-Language Medical Segmentation
par: Khadka, Pranjal
Publié: (2026)
par: Khadka, Pranjal
Publié: (2026)
Image Fusion via Vision-Language Model
par: Zhao, Zixiang, et autres
Publié: (2024)
par: Zhao, Zixiang, et autres
Publié: (2024)
Lightweight Metadata-Aware Mixture-of-Experts Masked Autoencoder for Earth Observation
par: Albughdadi, Mohanad
Publié: (2025)
par: Albughdadi, Mohanad
Publié: (2025)
MetaSegNet: Metadata-collaborative Vision-Language Representation Learning for Semantic Segmentation of Remote Sensing Images
par: Wang, Libo, et autres
Publié: (2023)
par: Wang, Libo, et autres
Publié: (2023)
Wavelet-Fusion Diffusion Model for Multimodal Brain MRI Synthesis with Modality and Metadata Conditioning
par: Yasinzai, Muhammad Nabi, et autres
Publié: (2026)
par: Yasinzai, Muhammad Nabi, et autres
Publié: (2026)
VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection
par: Taparia, Aditya, et autres
Publié: (2025)
par: Taparia, Aditya, et autres
Publié: (2025)
MangoLeafViT: Leveraging Lightweight Vision Transformer with Runtime Augmentation for Efficient Mango Leaf Disease Classification
par: Chowdhury, Rafi Hassan, et autres
Publié: (2025)
par: Chowdhury, Rafi Hassan, et autres
Publié: (2025)
VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
par: Bian, Jinyue, et autres
Publié: (2025)
par: Bian, Jinyue, et autres
Publié: (2025)
LiteViLNet: Lightweight Vision-LiDAR Fusion Network for Efficient Road Segmentation
par: Peng, Daojie, et autres
Publié: (2026)
par: Peng, Daojie, et autres
Publié: (2026)
Cross-Attentive Multiview Fusion of Vision-Language Embeddings
par: Martins, Tomas Berriel, et autres
Publié: (2026)
par: Martins, Tomas Berriel, et autres
Publié: (2026)
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
par: Han, Xiaofeng, et autres
Publié: (2025)
par: Han, Xiaofeng, et autres
Publié: (2025)
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
par: Li, Yuqi, et autres
Publié: (2025)
par: Li, Yuqi, et autres
Publié: (2025)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
par: Zhang, Ruifei, et autres
Publié: (2025)
par: Zhang, Ruifei, et autres
Publié: (2025)
DAIT: Distillation from Vision-Language Models to Lightweight Classifiers with Adaptive Intermediate Teacher Transfer
par: He, Zhengxu, et autres
Publié: (2026)
par: He, Zhengxu, et autres
Publié: (2026)
Lightweight Vision Transformer with Bidirectional Interaction
par: Fan, Qihang, et autres
Publié: (2023)
par: Fan, Qihang, et autres
Publié: (2023)
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
par: Yang, Fan, et autres
Publié: (2025)
par: Yang, Fan, et autres
Publié: (2025)
The Eye of Sherlock Holmes: Uncovering User Private Attribute Profiling via Vision-Language Model Agentic Framework
par: Liu, Feiran, et autres
Publié: (2025)
par: Liu, Feiran, et autres
Publié: (2025)
A Lightweight Feature Fusion Architecture For Resource-Constrained Crowd Counting
par: Chaudhuri, Yashwardhan, et autres
Publié: (2024)
par: Chaudhuri, Yashwardhan, et autres
Publié: (2024)
Metadata augmented deep neural networks for wild animal classification
par: Tøn, Aslak, et autres
Publié: (2024)
par: Tøn, Aslak, et autres
Publié: (2024)
SpiralMLP: A Lightweight Vision MLP Architecture
par: Mu, Haojie, et autres
Publié: (2024)
par: Mu, Haojie, et autres
Publié: (2024)
EVLF: Early Vision-Language Fusion for Generative Dataset Distillation
par: Cai, Wenqi, et autres
Publié: (2026)
par: Cai, Wenqi, et autres
Publié: (2026)
Enhanced Continual Learning of Vision-Language Models with Model Fusion
par: Gao, Haoyuan, et autres
Publié: (2025)
par: Gao, Haoyuan, et autres
Publié: (2025)
Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
par: Lin, Tao, et autres
Publié: (2026)
par: Lin, Tao, et autres
Publié: (2026)
ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video
par: Gupta, Rajan Das, et autres
Publié: (2025)
par: Gupta, Rajan Das, et autres
Publié: (2025)
MLLM-Enhanced Face Forgery Detection: A Vision-Language Fusion Solution
par: Peng, Siran, et autres
Publié: (2025)
par: Peng, Siran, et autres
Publié: (2025)
TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints
par: Ly, Vinh-Thuan, et autres
Publié: (2025)
par: Ly, Vinh-Thuan, et autres
Publié: (2025)
Lightweight Gaze Estimation Model Via Fusion Global Information
par: Cheng, Zhang, et autres
Publié: (2024)
par: Cheng, Zhang, et autres
Publié: (2024)
Lightweight RGB-T Tracking with Mobile Vision Transformers
par: Falaki, Mahdi, et autres
Publié: (2025)
par: Falaki, Mahdi, et autres
Publié: (2025)
Visual Bias and Interpretability in Deep Learning for Dermatological Image Analysis
par: Taufik, Enam Ahmed, et autres
Publié: (2025)
par: Taufik, Enam Ahmed, et autres
Publié: (2025)
SSFT: A Lightweight Spectral-Spatial Fusion Transformer for Generic Hyperspectral Classification
par: Musiat, Alexander, et autres
Publié: (2026)
par: Musiat, Alexander, et autres
Publié: (2026)
Documents similaires
-
Explicit Grammar Semantic Feature Fusion for Robust Text Classification
par: Sultana, Azrin, et autres
Publié: (2026) -
ColorFoil: Investigating Color Blindness in Large Vision and Language Models
par: Samin, Ahnaf Mozib, et autres
Publié: (2024) -
AquaFusionNet: Lightweight VisionSensor Fusion Framework for Real-Time Pathogen Detection and Water Quality Anomaly Prediction on Edge Devices
par: Kristanto, Sepyan Purnama, et autres
Publié: (2025) -
ControlFusion: A Controllable Image Fusion Framework with Language-Vision Degradation Prompts
par: Tang, Linfeng, et autres
Publié: (2025) -
Vision-Language Models for Automated Chest X-ray Interpretation: Leveraging ViT and GPT-2
par: Islam, Md. Rakibul, et autres
Publié: (2025)