Test-Time-Scaling for Zero-Shot Diagnosis with Visual-Language Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Byun, Ji Young, Park, Young-Jin, Azizan, Navid, Chellappa, Rama |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Uncertainty Quantification in Detection Transformers: Object-Level Calibration and Image-Level Reliability
par: Park, Young-Jin, et autres
Publié: (2024)
par: Park, Young-Jin, et autres
Publié: (2024)
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
par: Wei, Guoyizhe, et autres
Publié: (2025)
par: Wei, Guoyizhe, et autres
Publié: (2025)
DiffRegCD: Integrated Registration and Change Detection with Diffusion Features
par: Madani, Seyedehanita, et autres
Publié: (2025)
par: Madani, Seyedehanita, et autres
Publié: (2025)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
par: Pramanick, Shraman, et autres
Publié: (2024)
par: Pramanick, Shraman, et autres
Publié: (2024)
Zero-Shot Personalization of Objects via Textual Inversion
par: Roy, Aniket, et autres
Publié: (2026)
par: Roy, Aniket, et autres
Publié: (2026)
Zero-Shot Industrial Anomaly Segmentation with Image-Aware Prompt Generation
par: Park, SoYoung, et autres
Publié: (2025)
par: Park, SoYoung, et autres
Publié: (2025)
Language-Driven Visual Consensus for Zero-Shot Semantic Segmentation
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
Evolving, Not Training: Zero-Shot Reasoning Segmentation via Evolutionary Prompting
par: Ye, Kai, et autres
Publié: (2025)
par: Ye, Kai, et autres
Publié: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
par: Nagar, Aishik, et autres
Publié: (2024)
par: Nagar, Aishik, et autres
Publié: (2024)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
par: Han, Haonan, et autres
Publié: (2026)
par: Han, Haonan, et autres
Publié: (2026)
MatRes: Zero-Shot Test-Time Model Adaptation for Simultaneous Matching and Restoration
par: Lee, Kanggeon, et autres
Publié: (2026)
par: Lee, Kanggeon, et autres
Publié: (2026)
Encoding of Demographic and Anatomical Information in Chest X-Ray-based Severe Left Ventricular Hypertrophy Classifiers
par: Pal, Basudha, et autres
Publié: (2025)
par: Pal, Basudha, et autres
Publié: (2025)
Coherent Zero-Shot Visual Instruction Generation
par: Phung, Quynh, et autres
Publié: (2024)
par: Phung, Quynh, et autres
Publié: (2024)
MoECLIP: Patch-Specialized Experts for Zero-shot Anomaly Detection
par: Park, Jun Yeong, et autres
Publié: (2026)
par: Park, Jun Yeong, et autres
Publié: (2026)
NSSR-DIL: Null-Shot Image Super-Resolution Using Deep Identity Learning
par: S, Sree Rama Vamsidhar, et autres
Publié: (2024)
par: S, Sree Rama Vamsidhar, et autres
Publié: (2024)
Boosting Skeleton-based Zero-Shot Action Recognition with Training-Free Test-Time Adaptation
par: Zhu, Jingmin, et autres
Publié: (2025)
par: Zhu, Jingmin, et autres
Publié: (2025)
Development of Image Collection Method Using YOLO and Siamese Network
par: Shin, Chan Young, et autres
Publié: (2024)
par: Shin, Chan Young, et autres
Publié: (2024)
Visual Language Models as Zero-Shot Deepfake Detectors
par: Pirogov, Viacheslav
Publié: (2025)
par: Pirogov, Viacheslav
Publié: (2025)
Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation
par: Park, Jungwon, et autres
Publié: (2026)
par: Park, Jungwon, et autres
Publié: (2026)
DreamMotion: Space-Time Self-Similar Score Distillation for Zero-Shot Video Editing
par: Jeong, Hyeonho, et autres
Publié: (2024)
par: Jeong, Hyeonho, et autres
Publié: (2024)
Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
par: Dafnis, Konstantinos M., et autres
Publié: (2025)
par: Dafnis, Konstantinos M., et autres
Publié: (2025)
Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models
par: Sui, Elaine, et autres
Publié: (2024)
par: Sui, Elaine, et autres
Publié: (2024)
LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment
par: Hu, Junyi, et autres
Publié: (2026)
par: Hu, Junyi, et autres
Publié: (2026)
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
par: Yu, Xinlei, et autres
Publié: (2025)
par: Yu, Xinlei, et autres
Publié: (2025)
SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning
par: Chunhachatrachai, Pawat, et autres
Publié: (2026)
par: Chunhachatrachai, Pawat, et autres
Publié: (2026)
VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models
par: Ghosal, Soumya Suvra, et autres
Publié: (2026)
par: Ghosal, Soumya Suvra, et autres
Publié: (2026)
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
par: Hao, Chao, et autres
Publié: (2026)
par: Hao, Chao, et autres
Publié: (2026)
Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation
par: Park, Joonhyung, et autres
Publié: (2025)
par: Park, Joonhyung, et autres
Publié: (2025)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
par: Lim, Byeonggeuk, et autres
Publié: (2026)
par: Lim, Byeonggeuk, et autres
Publié: (2026)
SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization
par: Ahn, Young Jin, et autres
Publié: (2024)
par: Ahn, Young Jin, et autres
Publié: (2024)
TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision
par: Gupta, Ayush, et autres
Publié: (2025)
par: Gupta, Ayush, et autres
Publié: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
Test-Time Reasoning Through Visual Human Preferences with VLMs and Soft Rewards
par: Gambashidze, Alexander, et autres
Publié: (2025)
par: Gambashidze, Alexander, et autres
Publié: (2025)
SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
par: Lin, Jiawen, et autres
Publié: (2025)
par: Lin, Jiawen, et autres
Publié: (2025)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
par: Wang, Haibo, et autres
Publié: (2026)
par: Wang, Haibo, et autres
Publié: (2026)
Towards Zero-Shot & Explainable Video Description by Reasoning over Graphs of Events in Space and Time
par: Masala, Mihai, et autres
Publié: (2025)
par: Masala, Mihai, et autres
Publié: (2025)
Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned
par: Ong, Brandon, et autres
Publié: (2025)
par: Ong, Brandon, et autres
Publié: (2025)
SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models
par: Zantout, Nader, et autres
Publié: (2025)
par: Zantout, Nader, et autres
Publié: (2025)
Rethinking Plant Disease Diagnosis: Bridging the Academic-Practical Gap with Vision Transformers and Zero-Shot Learning
par: Benabbas, Wassim, et autres
Publié: (2025)
par: Benabbas, Wassim, et autres
Publié: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
par: Tan, Huajie, et autres
Publié: (2025)
par: Tan, Huajie, et autres
Publié: (2025)
Documents similaires
-
Uncertainty Quantification in Detection Transformers: Object-Level Calibration and Image-Level Reliability
par: Park, Young-Jin, et autres
Publié: (2024) -
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
par: Wei, Guoyizhe, et autres
Publié: (2025) -
DiffRegCD: Integrated Registration and Change Detection with Diffusion Features
par: Madani, Seyedehanita, et autres
Publié: (2025) -
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
par: Pramanick, Shraman, et autres
Publié: (2024) -
Zero-Shot Personalization of Objects via Textual Inversion
par: Roy, Aniket, et autres
Publié: (2026)