Salvato in:
| Autori principali: | Massih, Peter A., Cosatto, Eric |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.13401 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PixelArena: A benchmark for Pixel-Precision Visual Intelligence
di: Liang, Feng, et al.
Pubblicazione: (2025)
di: Liang, Feng, et al.
Pubblicazione: (2025)
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
MediSee: Reasoning-based Pixel-level Perception in Medical Images
di: Tong, Qinyue, et al.
Pubblicazione: (2025)
di: Tong, Qinyue, et al.
Pubblicazione: (2025)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
Seg the HAB: Language-Guided Geospatial Algae Bloom Reasoning and Segmentation
di: Hsieh, Patterson, et al.
Pubblicazione: (2025)
di: Hsieh, Patterson, et al.
Pubblicazione: (2025)
Pixelis: Reasoning in Pixels, from Seeing to Acting
di: Zhou, Yunpeng
Pubblicazione: (2026)
di: Zhou, Yunpeng
Pubblicazione: (2026)
Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning
di: Li, Xuchen, et al.
Pubblicazione: (2025)
di: Li, Xuchen, et al.
Pubblicazione: (2025)
PixelWeb: The First Web GUI Dataset with Pixel-Wise Labels
di: Yang, Qi, et al.
Pubblicazione: (2025)
di: Yang, Qi, et al.
Pubblicazione: (2025)
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs
di: Alansari, Mohamad, et al.
Pubblicazione: (2026)
di: Alansari, Mohamad, et al.
Pubblicazione: (2026)
The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
di: Sun, Yuwei, et al.
Pubblicazione: (2026)
di: Sun, Yuwei, et al.
Pubblicazione: (2026)
Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards
di: Xu, Chenhui, et al.
Pubblicazione: (2025)
di: Xu, Chenhui, et al.
Pubblicazione: (2025)
From Skeletons to Pixels: Few-Shot Precise Event Spotting via Representation and Prediction Distillation
di: Yeoh, Zhong Han Ervin, et al.
Pubblicazione: (2026)
di: Yeoh, Zhong Han Ervin, et al.
Pubblicazione: (2026)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
di: Deng, Andong, et al.
Pubblicazione: (2024)
di: Deng, Andong, et al.
Pubblicazione: (2024)
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
MEET: A Million-Scale Dataset for Fine-Grained Geospatial Scene Classification with Zoom-Free Remote Sensing Imagery
di: Li, Yansheng, et al.
Pubblicazione: (2025)
di: Li, Yansheng, et al.
Pubblicazione: (2025)
Lossy Neural Compression for Geospatial Analytics: A Review
di: Gomes, Carlos, et al.
Pubblicazione: (2025)
di: Gomes, Carlos, et al.
Pubblicazione: (2025)
FaceID-6M: A Large-Scale, Open-Source FaceID Customization Dataset
di: Wang, Shuhe, et al.
Pubblicazione: (2025)
di: Wang, Shuhe, et al.
Pubblicazione: (2025)
Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning
di: Xu, Yu, et al.
Pubblicazione: (2026)
di: Xu, Yu, et al.
Pubblicazione: (2026)
Smartflow: Enabling Scalable Spatiotemporal Geospatial Research
di: McVicar, David, et al.
Pubblicazione: (2025)
di: McVicar, David, et al.
Pubblicazione: (2025)
PixelGen: Improving Pixel Diffusion with Perceptual Supervision
di: Ma, Zehong, et al.
Pubblicazione: (2026)
di: Ma, Zehong, et al.
Pubblicazione: (2026)
Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models
di: Han, Tianyang, et al.
Pubblicazione: (2025)
di: Han, Tianyang, et al.
Pubblicazione: (2025)
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
di: Jiang, Yankai, et al.
Pubblicazione: (2026)
di: Jiang, Yankai, et al.
Pubblicazione: (2026)
Not All Pixels Are Equal: Pixel-wise Meta-Learning for Medical Segmentation with Noisy Labels
di: Mu, Chenyu, et al.
Pubblicazione: (2025)
di: Mu, Chenyu, et al.
Pubblicazione: (2025)
Compressing Vision Transformers in Geospatial Transfer Learning with Manifold-Constrained Optimization
di: Snyder, Thomas, et al.
Pubblicazione: (2026)
di: Snyder, Thomas, et al.
Pubblicazione: (2026)
Charting New Territories: Exploring the Geographic and Geospatial Capabilities of Multimodal LLMs
di: Roberts, Jonathan, et al.
Pubblicazione: (2023)
di: Roberts, Jonathan, et al.
Pubblicazione: (2023)
Towards Scalable Foundation Model for Multi-modal and Hyperspectral Geospatial Data
di: Si, Haozhe, et al.
Pubblicazione: (2025)
di: Si, Haozhe, et al.
Pubblicazione: (2025)
D-GAP: Improving Out-of-Domain Robustness via Dataset-Agnostic and Gradient-Guided Augmentation in Frequency and Pixel Spaces
di: Wang, Ruoqi, et al.
Pubblicazione: (2025)
di: Wang, Ruoqi, et al.
Pubblicazione: (2025)
Public Computer Vision Datasets for Precision Livestock Farming: A Systematic Survey
di: Bhujel, Anil, et al.
Pubblicazione: (2024)
di: Bhujel, Anil, et al.
Pubblicazione: (2024)
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
di: Li, Xinzhuo, et al.
Pubblicazione: (2025)
di: Li, Xinzhuo, et al.
Pubblicazione: (2025)
GEO-Bench-2: From Performance to Capability, Rethinking Evaluation in Geospatial AI
di: Simumba, Naomi, et al.
Pubblicazione: (2025)
di: Simumba, Naomi, et al.
Pubblicazione: (2025)
Utilizing a Geospatial Foundation Model for Coastline Delineation in Small Sandy Islands
di: Chhabra, Tishya, et al.
Pubblicazione: (2025)
di: Chhabra, Tishya, et al.
Pubblicazione: (2025)
Geo2Vec: Shape- and Distance-Aware Neural Representation of Geospatial Entities
di: Chu, Chen, et al.
Pubblicazione: (2025)
di: Chu, Chen, et al.
Pubblicazione: (2025)
ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models
di: Zhong, Jing, et al.
Pubblicazione: (2025)
di: Zhong, Jing, et al.
Pubblicazione: (2025)
CrossVIT-augmented Geospatial-Intelligence Visualization System for Tracking Economic Development Dynamics
di: Bai, Yanbing, et al.
Pubblicazione: (2024)
di: Bai, Yanbing, et al.
Pubblicazione: (2024)
Pixel-level Certified Explanations via Randomized Smoothing
di: Anani, Alaa, et al.
Pubblicazione: (2025)
di: Anani, Alaa, et al.
Pubblicazione: (2025)
FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales
di: Rodriguez, Jorge L., et al.
Pubblicazione: (2026)
di: Rodriguez, Jorge L., et al.
Pubblicazione: (2026)
Geospatial foundation models for image analysis: evaluating and enhancing NASA-IBM Prithvi's domain adaptability
di: Hsu, Chia-Yu, et al.
Pubblicazione: (2024)
di: Hsu, Chia-Yu, et al.
Pubblicazione: (2024)
ENTIRe-ID: An Extensive and Diverse Dataset for Person Re-Identification
di: Yildiz, Serdar, et al.
Pubblicazione: (2024)
di: Yildiz, Serdar, et al.
Pubblicazione: (2024)
LoD Sketch Extraction from Architectural Models Using Generative AI: Dataset Construction for Multi-Level Architectural Design Generation
di: Du, Xusheng, et al.
Pubblicazione: (2026)
di: Du, Xusheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
PixelArena: A benchmark for Pixel-Precision Visual Intelligence
di: Liang, Feng, et al.
Pubblicazione: (2025) -
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
di: Yan, Zhonghao, et al.
Pubblicazione: (2025) -
MediSee: Reasoning-based Pixel-level Perception in Medical Images
di: Tong, Qinyue, et al.
Pubblicazione: (2025) -
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
di: Wang, Haozhe, et al.
Pubblicazione: (2025) -
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)