Gespeichert in:
| 1. Verfasser: | Vo, Khang Hoang Nhat |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2605.07544 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Revolutionizing Precise Low Back Pain Diagnosis via Contrastive Learning
von: Le, Thanh Binh, et al.
Veröffentlicht: (2025)
von: Le, Thanh Binh, et al.
Veröffentlicht: (2025)
A Unified XAI-LLM Approach for EndotrachealSuctioning Activity Recognition
von: Phan, Hoang Khang, et al.
Veröffentlicht: (2026)
von: Phan, Hoang Khang, et al.
Veröffentlicht: (2026)
PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
von: Hoang-Xuan, Nhat, et al.
Veröffentlicht: (2025)
von: Hoang-Xuan, Nhat, et al.
Veröffentlicht: (2025)
ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
von: Tran, Quoc-Khang, et al.
Veröffentlicht: (2026)
von: Tran, Quoc-Khang, et al.
Veröffentlicht: (2026)
Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
von: Nguyen, Truong Thanh Hung, et al.
Veröffentlicht: (2026)
von: Nguyen, Truong Thanh Hung, et al.
Veröffentlicht: (2026)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models
von: Nguyen-Nhu, Tinh-Anh, et al.
Veröffentlicht: (2025)
von: Nguyen-Nhu, Tinh-Anh, et al.
Veröffentlicht: (2025)
From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models
von: Athalye, Ashay, et al.
Veröffentlicht: (2024)
von: Athalye, Ashay, et al.
Veröffentlicht: (2024)
From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature
von: Yuan, Kun, et al.
Veröffentlicht: (2025)
von: Yuan, Kun, et al.
Veröffentlicht: (2025)
Towards Cultural Bridge by Bahnaric-Vietnamese Translation Using Transfer Learning of Sequence-To-Sequence Pre-training Language Model
von: Dat, Phan Tran Minh, et al.
Veröffentlicht: (2025)
von: Dat, Phan Tran Minh, et al.
Veröffentlicht: (2025)
Latent Domain Prompt Learning for Vision-Language Models
von: Li, Zhixing, et al.
Veröffentlicht: (2025)
von: Li, Zhixing, et al.
Veröffentlicht: (2025)
Single-Pixel Vision-Language Model for Intrinsic Privacy-Preserving Behavioral Intelligence
von: An, Hongjun, et al.
Veröffentlicht: (2026)
von: An, Hongjun, et al.
Veröffentlicht: (2026)
From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models
von: Khokhar, Pir Bakhsh, et al.
Veröffentlicht: (2026)
von: Khokhar, Pir Bakhsh, et al.
Veröffentlicht: (2026)
Rethinking Top Probability from Multi-view for Distracted Driver Behaviour Localization
von: Nguyen, Quang Vinh, et al.
Veröffentlicht: (2024)
von: Nguyen, Quang Vinh, et al.
Veröffentlicht: (2024)
Evolving Prompt Adaptation for Vision-Language Models
von: Zhang, Enming, et al.
Veröffentlicht: (2026)
von: Zhang, Enming, et al.
Veröffentlicht: (2026)
Adversarial Prompt Tuning for Vision-Language Models
von: Zhang, Jiaming, et al.
Veröffentlicht: (2023)
von: Zhang, Jiaming, et al.
Veröffentlicht: (2023)
Adversarial Prompt Distillation for Vision-Language Models
von: Luo, Lin, et al.
Veröffentlicht: (2024)
von: Luo, Lin, et al.
Veröffentlicht: (2024)
Multilingual Pretraining for Pixel Language Models
von: Kesen, Ilker, et al.
Veröffentlicht: (2025)
von: Kesen, Ilker, et al.
Veröffentlicht: (2025)
LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases
von: Quoc, Khang Nguyen, et al.
Veröffentlicht: (2026)
von: Quoc, Khang Nguyen, et al.
Veröffentlicht: (2026)
A Study of Vulnerability Repair in JavaScript Programs with Large Language Models
von: Le, Tan Khang, et al.
Veröffentlicht: (2024)
von: Le, Tan Khang, et al.
Veröffentlicht: (2024)
LangXAI: Integrating Large Vision Models for Generating Textual Explanations to Enhance Explainability in Visual Perception Tasks
von: Nguyen, Truong Thanh Hung, et al.
Veröffentlicht: (2024)
von: Nguyen, Truong Thanh Hung, et al.
Veröffentlicht: (2024)
FedMPT: Federated Multi-label Prompt Tuning of Vision-Language Models
von: Wang, Xucong, et al.
Veröffentlicht: (2026)
von: Wang, Xucong, et al.
Veröffentlicht: (2026)
ROSGPT_Vision: Commanding Robots Using Only Language Models' Prompts
von: Benjdira, Bilel, et al.
Veröffentlicht: (2023)
von: Benjdira, Bilel, et al.
Veröffentlicht: (2023)
Aquila-plus: Prompt-Driven Visual-Language Models for Pixel-Level Remote Sensing Image Understanding
von: Lu, Kaixuan
Veröffentlicht: (2024)
von: Lu, Kaixuan
Veröffentlicht: (2024)
Multi-Agent Training for Pommerman: Curriculum Learning and Population-based Self-Play Approach
von: Huynh, Nhat-Minh, et al.
Veröffentlicht: (2024)
von: Huynh, Nhat-Minh, et al.
Veröffentlicht: (2024)
Domain-Invariant Prompt Learning for Vision-Language Models
von: Khoee, Arsham Gholamzadeh, et al.
Veröffentlicht: (2026)
von: Khoee, Arsham Gholamzadeh, et al.
Veröffentlicht: (2026)
Target Prompting for Information Extraction with Vision Language Model
von: Medhi, Dipankar
Veröffentlicht: (2024)
von: Medhi, Dipankar
Veröffentlicht: (2024)
Prompting Large Vision-Language Models for Compositional Reasoning
von: Ossowski, Timothy, et al.
Veröffentlicht: (2024)
von: Ossowski, Timothy, et al.
Veröffentlicht: (2024)
Attention Prompting on Image for Large Vision-Language Models
von: Yu, Runpeng, et al.
Veröffentlicht: (2024)
von: Yu, Runpeng, et al.
Veröffentlicht: (2024)
Training-Free Unsupervised Prompt for Vision-Language Models
von: Long, Sifan, et al.
Veröffentlicht: (2024)
von: Long, Sifan, et al.
Veröffentlicht: (2024)
PLPP: Prompt Learning with Perplexity Is Self-Distillation for Vision-Language Models
von: Liu, Biao, et al.
Veröffentlicht: (2024)
von: Liu, Biao, et al.
Veröffentlicht: (2024)
Dynamic Theory of Mind as a Temporal Memory Problem: Evidence from Large Language Models
von: Nguyen, Thuy Ngoc, et al.
Veröffentlicht: (2026)
von: Nguyen, Thuy Ngoc, et al.
Veröffentlicht: (2026)
DKPROMPT: Domain Knowledge Prompting Vision-Language Models for Open-World Planning
von: Zhang, Xiaohan, et al.
Veröffentlicht: (2024)
von: Zhang, Xiaohan, et al.
Veröffentlicht: (2024)
Context-Adaptive Multi-Prompt Embedding with Large Language Models for Vision-Language Alignment
von: Kim, Dahun, et al.
Veröffentlicht: (2025)
von: Kim, Dahun, et al.
Veröffentlicht: (2025)
AgentSGEN: Multi-Agent LLM in the Loop for Semantic Collaboration and GENeration of Synthetic Data
von: Xuan, Vu Dinh, et al.
Veröffentlicht: (2025)
von: Xuan, Vu Dinh, et al.
Veröffentlicht: (2025)
ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks
von: ALBarqawi, Ahmad, et al.
Veröffentlicht: (2025)
von: ALBarqawi, Ahmad, et al.
Veröffentlicht: (2025)
From Coordinates to Context: An LLM-Bootstrapped Semantic Encoding Framework for Privacy-Preserving Mobile Sensing Stress Recognition
von: Phan, Hoang Khang, et al.
Veröffentlicht: (2025)
von: Phan, Hoang Khang, et al.
Veröffentlicht: (2025)
Leveraging Model Soups to Classify Intangible Cultural Heritage Images from the Mekong Delta
von: Tran, Quoc-Khang, et al.
Veröffentlicht: (2026)
von: Tran, Quoc-Khang, et al.
Veröffentlicht: (2026)
Physical Prompt Injection Attacks on Large Vision-Language Models
von: Ling, Chen, et al.
Veröffentlicht: (2026)
von: Ling, Chen, et al.
Veröffentlicht: (2026)
BERT-based model for Vietnamese Fact Verification Dataset
von: Tran, Bao, et al.
Veröffentlicht: (2025)
von: Tran, Bao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Revolutionizing Precise Low Back Pain Diagnosis via Contrastive Learning
von: Le, Thanh Binh, et al.
Veröffentlicht: (2025) -
A Unified XAI-LLM Approach for EndotrachealSuctioning Activity Recognition
von: Phan, Hoang Khang, et al.
Veröffentlicht: (2026) -
PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
von: Hoang-Xuan, Nhat, et al.
Veröffentlicht: (2025) -
ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
von: Tran, Quoc-Khang, et al.
Veröffentlicht: (2026) -
Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
von: Nguyen, Truong Thanh Hung, et al.
Veröffentlicht: (2026)