From Web to Pixels: Bringing Agentic Search into Visual Perception
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Bokang, Sun, Xinyi, Feng, Kaituo, Dong, Xingping, Wu, Dongming, Yue, Xiangyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Gen-Searcher: Reinforcing Agentic Search for Image Generation
par: Feng, Kaituo, et autres
Publié: (2026)
par: Feng, Kaituo, et autres
Publié: (2026)
SpaceVista: All-Scale Visual Spatial Reasoning from mm to km
par: Sun, Peiwen, et autres
Publié: (2025)
par: Sun, Peiwen, et autres
Publié: (2025)
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
par: Zhang, Yani, et autres
Publié: (2025)
par: Zhang, Yani, et autres
Publié: (2025)
Bootstrapping Referring Multi-Object Tracking
par: Zhang, Yani, et autres
Publié: (2024)
par: Zhang, Yani, et autres
Publié: (2024)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
par: Fan, Kaixuan, et autres
Publié: (2025)
par: Fan, Kaixuan, et autres
Publié: (2025)
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
par: Chen, Shuang, et autres
Publié: (2026)
par: Chen, Shuang, et autres
Publié: (2026)
Bringing Multimodality to Amazon Visual Search System
par: Zhu, Xinliang, et autres
Publié: (2024)
par: Zhu, Xinliang, et autres
Publié: (2024)
From Semantics to Pixels: Coarse-to-Fine Masked Autoencoders for Hierarchical Visual Understanding
par: Xiang, Wenzhao, et autres
Publié: (2026)
par: Xiang, Wenzhao, et autres
Publié: (2026)
LAVA: Layered Audio-Visual Anti-tampering Watermarking for Robust Deepfake Detection and Localization
par: Zeng, Bokang, et autres
Publié: (2026)
par: Zeng, Bokang, et autres
Publié: (2026)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
par: Yue, Zhengrong, et autres
Publié: (2025)
par: Yue, Zhengrong, et autres
Publié: (2025)
In Pursuit of Pixel Supervision for Visual Pre-training
par: Yang, Lihe, et autres
Publié: (2025)
par: Yang, Lihe, et autres
Publié: (2025)
From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception
par: Zhu, Jilong, et autres
Publié: (2026)
par: Zhu, Jilong, et autres
Publié: (2026)
Pixel-Perfect Visual Geometry Estimation
par: Xu, Gangwei, et autres
Publié: (2026)
par: Xu, Gangwei, et autres
Publié: (2026)
Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization
par: Wang, Yikun, et autres
Publié: (2025)
par: Wang, Yikun, et autres
Publié: (2025)
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
par: Peng, Xiangyu, et autres
Publié: (2026)
par: Peng, Xiangyu, et autres
Publié: (2026)
Thinking in 360°: Humanoid Visual Search in the Wild
par: Yu, Heyang, et autres
Publié: (2025)
par: Yu, Heyang, et autres
Publié: (2025)
Video-R1: Reinforcing Video Reasoning in MLLMs
par: Feng, Kaituo, et autres
Publié: (2025)
par: Feng, Kaituo, et autres
Publié: (2025)
SAM2-ELNet: Label Enhancement and Automatic Annotation for Remote Sensing Segmentation
par: Yang, Jianhao, et autres
Publié: (2025)
par: Yang, Jianhao, et autres
Publié: (2025)
From Pixels to Purchase: Building and Evaluating a Taxonomy-Decoupled Visual Search Engine for Home Goods E-commerce
par: Lyu, Cheng, et autres
Publié: (2026)
par: Lyu, Cheng, et autres
Publié: (2026)
PixelWeb: The First Web GUI Dataset with Pixel-Wise Labels
par: Yang, Qi, et autres
Publié: (2025)
par: Yang, Qi, et autres
Publié: (2025)
From Waveforms to Pixels: A Survey on Audio-Visual Segmentation
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
PixelArena: A benchmark for Pixel-Precision Visual Intelligence
par: Liang, Feng, et autres
Publié: (2025)
par: Liang, Feng, et autres
Publié: (2025)
Towards Visual Query Localization in the 3D World
par: Peng, Liang, et autres
Publié: (2026)
par: Peng, Liang, et autres
Publié: (2026)
Towards Pixel-Level VLM Perception via Simple Points Prediction
par: Song, Tianhui, et autres
Publié: (2026)
par: Song, Tianhui, et autres
Publié: (2026)
Scan Clusters, Not Pixels: A Cluster-Centric Paradigm for Efficient Ultra-high-definition Image Restoration
par: Wu, Chen, et autres
Publié: (2026)
par: Wu, Chen, et autres
Publié: (2026)
Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning
par: Xu, Yu, et autres
Publié: (2026)
par: Xu, Yu, et autres
Publié: (2026)
From Pixels to Words -- Towards Native One-Vision Models at Scale
par: Diao, Haiwen, et autres
Publié: (2026)
par: Diao, Haiwen, et autres
Publié: (2026)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
par: Wu, Junfei, et autres
Publié: (2025)
par: Wu, Junfei, et autres
Publié: (2025)
DINOv3 Visual Representations for Blueberry Perception Toward Robotic Harvesting
par: Wang, Rui-Feng, et autres
Publié: (2026)
par: Wang, Rui-Feng, et autres
Publié: (2026)
Adaptive Debiasing Tsallis Entropy for Test-Time Adaptation
par: Wu, Xiangyu, et autres
Publié: (2026)
par: Wu, Xiangyu, et autres
Publié: (2026)
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
par: Jia, Yiming, et autres
Publié: (2025)
par: Jia, Yiming, et autres
Publié: (2025)
OneThinker: All-in-one Reasoning Model for Image and Video
par: Feng, Kaituo, et autres
Publié: (2025)
par: Feng, Kaituo, et autres
Publié: (2025)
CLIP Brings Better Features to Visual Aesthetics Learners
par: Xu, Liwu, et autres
Publié: (2023)
par: Xu, Liwu, et autres
Publié: (2023)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
par: Liu, Ye, et autres
Publié: (2025)
par: Liu, Ye, et autres
Publié: (2025)
Conquering the Retina: Bringing Visual in-Context Learning to OCT
par: Negrini, Alessio, et autres
Publié: (2025)
par: Negrini, Alessio, et autres
Publié: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
par: Shang, Yuying, et autres
Publié: (2024)
par: Shang, Yuying, et autres
Publié: (2024)
MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
par: Gupta, Tanmay, et autres
Publié: (2026)
par: Gupta, Tanmay, et autres
Publié: (2026)
WebCryptoAgent: Agentic Crypto Trading with Web Informatics
par: Kurban, Ali, et autres
Publié: (2026)
par: Kurban, Ali, et autres
Publié: (2026)
Agentic Keyframe Search for Video Question Answering
par: Fan, Sunqi, et autres
Publié: (2025)
par: Fan, Sunqi, et autres
Publié: (2025)
Documents similaires
-
Gen-Searcher: Reinforcing Agentic Search for Image Generation
par: Feng, Kaituo, et autres
Publié: (2026) -
SpaceVista: All-Scale Visual Spatial Reasoning from mm to km
par: Sun, Peiwen, et autres
Publié: (2025) -
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
par: Zhang, Yani, et autres
Publié: (2025) -
Bootstrapping Referring Multi-Object Tracking
par: Zhang, Yani, et autres
Publié: (2024) -
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
par: Fan, Kaixuan, et autres
Publié: (2025)