V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Han, Yang, Yi, Hu, Jingyuan, Zhu, Minfeng, Chen, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
di: Pan, Hongkun, et al.
Pubblicazione: (2026)
di: Pan, Hongkun, et al.
Pubblicazione: (2026)
Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
di: Hong, Yunqi, et al.
Pubblicazione: (2025)
di: Hong, Yunqi, et al.
Pubblicazione: (2025)
Language-Driven Anchors for Zero-Shot Adversarial Robustness
di: Li, Xiao, et al.
Pubblicazione: (2023)
di: Li, Xiao, et al.
Pubblicazione: (2023)
Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards
di: Xu, Chenhui, et al.
Pubblicazione: (2025)
di: Xu, Chenhui, et al.
Pubblicazione: (2025)
Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers
di: Stanić, Aleksandar, et al.
Pubblicazione: (2024)
di: Stanić, Aleksandar, et al.
Pubblicazione: (2024)
Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model
di: Chen, Hongxu, et al.
Pubblicazione: (2025)
di: Chen, Hongxu, et al.
Pubblicazione: (2025)
A Recipe for Improving Remote Sensing VLM Zero Shot Generalization
di: Barzilai, Aviad, et al.
Pubblicazione: (2025)
di: Barzilai, Aviad, et al.
Pubblicazione: (2025)
No Labels Needed: Zero-Shot Image Classification with Collaborative Self-Learning
di: Todescato, Matheus Vinícius, et al.
Pubblicazione: (2025)
di: Todescato, Matheus Vinícius, et al.
Pubblicazione: (2025)
Improving Zero-shot Generalization of Learned Prompts via Unsupervised Knowledge Distillation
di: Mistretta, Marco, et al.
Pubblicazione: (2024)
di: Mistretta, Marco, et al.
Pubblicazione: (2024)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model
di: Zhou, Hengguang, et al.
Pubblicazione: (2025)
di: Zhou, Hengguang, et al.
Pubblicazione: (2025)
OBSER: Object-Based Sub-Environment Recognition for Zero-Shot Environmental Inference
di: Choi, Won-Seok, et al.
Pubblicazione: (2025)
di: Choi, Won-Seok, et al.
Pubblicazione: (2025)
GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
di: V Team, et al.
Pubblicazione: (2025)
di: V Team, et al.
Pubblicazione: (2025)
Hierarchically Robust Zero-shot Vision-language Models
di: Dong, Junhao, et al.
Pubblicazione: (2026)
di: Dong, Junhao, et al.
Pubblicazione: (2026)
Diving into Self-Evolving Training for Multimodal Reasoning
di: Liu, Wei, et al.
Pubblicazione: (2024)
di: Liu, Wei, et al.
Pubblicazione: (2024)
Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study
di: Wang, Chenguang, et al.
Pubblicazione: (2024)
di: Wang, Chenguang, et al.
Pubblicazione: (2024)
V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2026)
Zero-Shot Neural Architecture Search with Weighted Response Correlation
di: Jing, Kun, et al.
Pubblicazione: (2025)
di: Jing, Kun, et al.
Pubblicazione: (2025)
Diffusion Self-Distillation for Zero-Shot Customized Image Generation
di: Cai, Shengqu, et al.
Pubblicazione: (2024)
di: Cai, Shengqu, et al.
Pubblicazione: (2024)
Open Multimodal Retrieval-Augmented Factual Image Generation
di: Tian, Yang, et al.
Pubblicazione: (2025)
di: Tian, Yang, et al.
Pubblicazione: (2025)
Seeing Beyond Frames: Zero-Shot Pedestrian Intention Prediction with Raw Temporal Video and Multimodal Cues
di: Zambare, Pallavi, et al.
Pubblicazione: (2025)
di: Zambare, Pallavi, et al.
Pubblicazione: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
Zero-shot Emotion Annotation in Facial Images Using Large Multimodal Models: Benchmarking and Prospects for Multi-Class, Multi-Frame Approaches
di: Zhang, He, et al.
Pubblicazione: (2025)
di: Zhang, He, et al.
Pubblicazione: (2025)
Zero-shot Concept Bottleneck Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
Zero-Shot Decentralized Federated Learning
di: Masano, Alessio, et al.
Pubblicazione: (2025)
di: Masano, Alessio, et al.
Pubblicazione: (2025)
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
Masking Improves Contrastive Self-Supervised Learning for ConvNets, and Saliency Tells You Where
di: Chin, Zhi-Yi, et al.
Pubblicazione: (2023)
di: Chin, Zhi-Yi, et al.
Pubblicazione: (2023)
Intriguing Differences Between Zero-Shot and Systematic Evaluations of Vision-Language Transformer Models
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
MaRS: A Fast Sampler for Mean Reverting Diffusion based on ODE and SDE Solvers
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
Zero-Shot Action Generalization with Limited Observations
di: Alchihabi, Abdullah, et al.
Pubblicazione: (2025)
di: Alchihabi, Abdullah, et al.
Pubblicazione: (2025)
Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary
di: Florea, Alexandru, et al.
Pubblicazione: (2026)
di: Florea, Alexandru, et al.
Pubblicazione: (2026)
IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers
di: Yang, Chenglin, et al.
Pubblicazione: (2023)
di: Yang, Chenglin, et al.
Pubblicazione: (2023)
SimSAM: Zero-shot Medical Image Segmentation via Simulated Interaction
di: Towle, Benjamin, et al.
Pubblicazione: (2024)
di: Towle, Benjamin, et al.
Pubblicazione: (2024)
The False Promise of Zero-Shot Super-Resolution in Machine-Learned Operators
di: Sakarvadia, Mansi, et al.
Pubblicazione: (2025)
di: Sakarvadia, Mansi, et al.
Pubblicazione: (2025)
Zero-Shot Vehicle Model Recognition via Text-Based Retrieval-Augmented Generation
di: Chang, Wei-Chia, et al.
Pubblicazione: (2025)
di: Chang, Wei-Chia, et al.
Pubblicazione: (2025)
VisionTS: Visual Masked Autoencoders Are Free-Lunch Zero-Shot Time Series Forecasters
di: Chen, Mouxiang, et al.
Pubblicazione: (2024)
di: Chen, Mouxiang, et al.
Pubblicazione: (2024)
Zero-Shot Quantization via Weight-Space Arithmetic
di: Solombrino, Daniele, et al.
Pubblicazione: (2026)
di: Solombrino, Daniele, et al.
Pubblicazione: (2026)
Visual Language Models as Zero-Shot Deepfake Detectors
di: Pirogov, Viacheslav
Pubblicazione: (2025)
di: Pirogov, Viacheslav
Pubblicazione: (2025)
M3Ret: Unleashing Zero-shot Multimodal Medical Image Retrieval via Self-Supervision
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
Vision-Language Models Can Self-Improve Reasoning via Reflection
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
di: Pan, Hongkun, et al.
Pubblicazione: (2026) -
Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
di: Hong, Yunqi, et al.
Pubblicazione: (2025) -
Language-Driven Anchors for Zero-Shot Adversarial Robustness
di: Li, Xiao, et al.
Pubblicazione: (2023) -
Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards
di: Xu, Chenhui, et al.
Pubblicazione: (2025) -
Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers
di: Stanić, Aleksandar, et al.
Pubblicazione: (2024)