Less Detail, Better Answers: Degradation-Driven Prompting for VQA
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Haoxuan, Wang, Weijie, Zhang, Zeyu, He, Yefei, Zhuang, Bohan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges
par: Jon, Hyo Jin, et autres
Publié: (2026)
par: Jon, Hyo Jin, et autres
Publié: (2026)
MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion
par: Tu, Shuyuan, et autres
Publié: (2024)
par: Tu, Shuyuan, et autres
Publié: (2024)
Ask2Loc: Learning to Locate Instructional Visual Answers by Asking Questions
par: Zong, Chang, et autres
Publié: (2025)
par: Zong, Chang, et autres
Publié: (2025)
When Less is Enough: Adaptive Token Reduction for Efficient Image Representation
par: Allakhverdov, Eduard, et autres
Publié: (2025)
par: Allakhverdov, Eduard, et autres
Publié: (2025)
TALON: Test-time Adaptive Learning for On-the-Fly Category Discovery
par: Wu, Yanan, et autres
Publié: (2026)
par: Wu, Yanan, et autres
Publié: (2026)
PAT-VCM: Plug-and-Play Auxiliary Tokens for Video Coding for Machines
par: Jiang, Wei, et autres
Publié: (2026)
par: Jiang, Wei, et autres
Publié: (2026)
Bench2FreeAD: A Benchmark for Vision-based End-to-end Navigation in Unstructured Robotic Environments
par: Peng, Yuhang, et autres
Publié: (2025)
par: Peng, Yuhang, et autres
Publié: (2025)
An Individual Identity-Driven Framework for Animal Re-Identification
par: Wu, Yihao, et autres
Publié: (2024)
par: Wu, Yihao, et autres
Publié: (2024)
Learning through Creation: A Hash-Free Framework for On-the-Fly Category Discovery
par: Zhang, Bohan, et autres
Publié: (2026)
par: Zhang, Bohan, et autres
Publié: (2026)
Depth Priors in Removal Neural Radiance Fields
par: Guo, Zhihao, et autres
Publié: (2024)
par: Guo, Zhihao, et autres
Publié: (2024)
Interactive Image Selection and Training for Brain Tumor Segmentation Network
par: Cerqueira, Matheus A., et autres
Publié: (2024)
par: Cerqueira, Matheus A., et autres
Publié: (2024)
MvBody: Multi-View-Based Hybrid Transformer Using Optical 3D Body Scan for Explainable Cesarean Section Prediction
par: Cheng, Ruting, et autres
Publié: (2025)
par: Cheng, Ruting, et autres
Publié: (2025)
Performance Decay in Deepfake Detection: The Limitations of Training on Outdated Data
par: Richings, Jack, et autres
Publié: (2025)
par: Richings, Jack, et autres
Publié: (2025)
Gaussian-Constrained LeJEPA Representations for Unsupervised Scene Discovery and Pose Consistency
par: Mostafa, Mohsen
Publié: (2026)
par: Mostafa, Mohsen
Publié: (2026)
SealD-NeRF: Interactive Pixel-Level Editing for Dynamic Scenes by Neural Radiance Fields
par: Huang, Zhentao, et autres
Publié: (2024)
par: Huang, Zhentao, et autres
Publié: (2024)
An inpainting approach to manipulate asymmetry in pre-operative breast images
par: Montenegro, Helena, et autres
Publié: (2025)
par: Montenegro, Helena, et autres
Publié: (2025)
QCFace: Image Quality Control for boosting Face Representation & Recognition
par: Doan-Ngo, Duc-Phuong, et autres
Publié: (2025)
par: Doan-Ngo, Duc-Phuong, et autres
Publié: (2025)
Real-time Object and Event Detection Service through Computer Vision and Edge Computing
par: Mendes, Marcos, et autres
Publié: (2025)
par: Mendes, Marcos, et autres
Publié: (2025)
Not all Views are Created Equal: Analyzing Viewpoint Instabilities in Vision Foundation Models
par: Michalkiewicz, Mateusz, et autres
Publié: (2024)
par: Michalkiewicz, Mateusz, et autres
Publié: (2024)
DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline
par: Zhang, Rui, et autres
Publié: (2025)
par: Zhang, Rui, et autres
Publié: (2025)
CylinderPlane: Nested Cylinder Representation for 3D-aware Image Generation
par: Jia, Ru, et autres
Publié: (2025)
par: Jia, Ru, et autres
Publié: (2025)
Robust Perspective Correction for Real-World Crack Evolution Tracking in Image-Based Structural Health Monitoring
par: Sun, Xinxin, et autres
Publié: (2025)
par: Sun, Xinxin, et autres
Publié: (2025)
GP-GS: Gaussian Processes Densification for 3D Gaussian Splatting
par: Guo, Zhihao, et autres
Publié: (2025)
par: Guo, Zhihao, et autres
Publié: (2025)
Single-Scanline Relative Pose Estimation for Rolling Shutter Cameras
par: Hruby, Petr, et autres
Publié: (2025)
par: Hruby, Petr, et autres
Publié: (2025)
Efficient Solution of Point-Line Absolute Pose
par: Hruby, Petr, et autres
Publié: (2024)
par: Hruby, Petr, et autres
Publié: (2024)
Minimal Solvers for Full DoF Motion Estimation from Asynchronous Tracks
par: Hruby, Petr, et autres
Publié: (2025)
par: Hruby, Petr, et autres
Publié: (2025)
How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study
par: Brusnicki, Roberto, et autres
Publié: (2026)
par: Brusnicki, Roberto, et autres
Publié: (2026)
Z-Order Transformer for Feed-Forward Gaussian Splatting
par: Wang, Can, et autres
Publié: (2026)
par: Wang, Can, et autres
Publié: (2026)
Motion Consistency Loss for Monocular Visual Odometry with Attention-Based Deep Learning
par: Françani, André O., et autres
Publié: (2024)
par: Françani, André O., et autres
Publié: (2024)
ASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLM
par: Wang, Yujun, et autres
Publié: (2025)
par: Wang, Yujun, et autres
Publié: (2025)
Large Language Models Powered Context-aware Motion Prediction in Autonomous Driving
par: Zheng, Xiaoji, et autres
Publié: (2024)
par: Zheng, Xiaoji, et autres
Publié: (2024)
ResPlan: A Large-Scale Vector-Graph Dataset of 17,000 Residential Floor Plans
par: Abouagour, Mohamed, et autres
Publié: (2025)
par: Abouagour, Mohamed, et autres
Publié: (2025)
EatGAN: An Edge-Attention Guided Generative Adversarial Network for Single Image Super-Resolution
par: Rao, Penghao, et autres
Publié: (2025)
par: Rao, Penghao, et autres
Publié: (2025)
TWIG: Two-Step Image Generation using Segmentation Masks in Diffusion Models
par: Rakib, Mazharul Islam, et autres
Publié: (2025)
par: Rakib, Mazharul Islam, et autres
Publié: (2025)
Isolated Sign Language Recognition with Segmentation and Pose Estimation
par: Perkins, Daniel, et autres
Publié: (2025)
par: Perkins, Daniel, et autres
Publié: (2025)
HEDGE: Hallucination Estimation via Dense Geometric Entropy for VQA with Vision-Language Models
par: Gautam, Sushant, et autres
Publié: (2025)
par: Gautam, Sushant, et autres
Publié: (2025)
Detailed Evaluation of Modern Machine Learning Approaches for Optic Plastics Sorting
par: Maheshkar, Vaishali, et autres
Publié: (2025)
par: Maheshkar, Vaishali, et autres
Publié: (2025)
Knowledge-Guided Failure Prediction: Detecting When Object Detectors Miss Safety-Critical Objects
par: Zimmermann, Jakob Paul, et autres
Publié: (2026)
par: Zimmermann, Jakob Paul, et autres
Publié: (2026)
FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
par: Zhou, Junkang, et autres
Publié: (2026)
par: Zhou, Junkang, et autres
Publié: (2026)
Sequence Transferability and Task Order Selection in Continual Learning
par: Nguyen, Thinh, et autres
Publié: (2025)
par: Nguyen, Thinh, et autres
Publié: (2025)
Documents similaires
-
EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges
par: Jon, Hyo Jin, et autres
Publié: (2026) -
MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion
par: Tu, Shuyuan, et autres
Publié: (2024) -
Ask2Loc: Learning to Locate Instructional Visual Answers by Asking Questions
par: Zong, Chang, et autres
Publié: (2025) -
When Less is Enough: Adaptive Token Reduction for Efficient Image Representation
par: Allakhverdov, Eduard, et autres
Publié: (2025) -
TALON: Test-time Adaptive Learning for On-the-Fly Category Discovery
par: Wu, Yanan, et autres
Publié: (2026)