PixelThink: Towards Efficient Chain-of-Pixel Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Song, Fang, Gongfan, Kong, Lingdong, Li, Xiangtai, Xu, Jianyun, Yang, Sheng, Li, Qiang, Zhu, Jianke, Wang, Xinchao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diversity-Guided MLP Reduction for Efficient Large Vision Transformers
por: Shen, Chengchao, et al.
Publicado: (2025)
por: Shen, Chengchao, et al.
Publicado: (2025)
PointLoRA: Low-Rank Adaptation with Token Selection for Point Cloud Learning
por: Wang, Song, et al.
Publicado: (2025)
por: Wang, Song, et al.
Publicado: (2025)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025)
por: Meng, Jiahao, et al.
Publicado: (2025)
Context and Pixel Aware Large Language Model for Video Quality Assessment
por: Wen, Wen, et al.
Publicado: (2025)
por: Wen, Wen, et al.
Publicado: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer
por: Cai, Qi, et al.
Publicado: (2026)
por: Cai, Qi, et al.
Publicado: (2026)
Food Portion Estimation: From Pixels to Calories
por: Vinod, Gautham, et al.
Publicado: (2026)
por: Vinod, Gautham, et al.
Publicado: (2026)
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
por: Feng, Sicheng, et al.
Publicado: (2025)
por: Feng, Sicheng, et al.
Publicado: (2025)
OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation
por: Gan, Qijun, et al.
Publicado: (2025)
por: Gan, Qijun, et al.
Publicado: (2025)
Event Camera Demosaicing via Swin Transformer and Pixel-focus Loss
por: Lu, Yunfan, et al.
Publicado: (2024)
por: Lu, Yunfan, et al.
Publicado: (2024)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
por: Lu, Zhenyu, et al.
Publicado: (2025)
por: Lu, Zhenyu, et al.
Publicado: (2025)
PixelatedScatter: Arbitrary-level Visual Abstraction for Large-scale Multiclass Scatterplots
por: Guo, Ziheng, et al.
Publicado: (2025)
por: Guo, Ziheng, et al.
Publicado: (2025)
From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images
por: Chen, Yiming, et al.
Publicado: (2025)
por: Chen, Yiming, et al.
Publicado: (2025)
Reverse Region-to-Entity Annotation for Pixel-Level Visual Entity Linking
por: Xu, Zhengfei, et al.
Publicado: (2024)
por: Xu, Zhengfei, et al.
Publicado: (2024)
PianoMotion10M: Dataset and Benchmark for Hand Motion Generation in Piano Performance
por: Gan, Qijun, et al.
Publicado: (2024)
por: Gan, Qijun, et al.
Publicado: (2024)
FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved Optimally
por: Shen, Qiuhong, et al.
Publicado: (2024)
por: Shen, Qiuhong, et al.
Publicado: (2024)
Harmonizing Pixels and Melodies: Maestro-Guided Film Score Generation and Composition Style Transfer
por: Qi, F., et al.
Publicado: (2024)
por: Qi, F., et al.
Publicado: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
D-FCGS: Feedforward Compression of Dynamic Gaussian Splatting for Free-Viewpoint Videos
por: Zhang, Wenkang, et al.
Publicado: (2025)
por: Zhang, Wenkang, et al.
Publicado: (2025)
Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
por: Zhang, Dongxu, et al.
Publicado: (2026)
por: Zhang, Dongxu, et al.
Publicado: (2026)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2025)
por: Zhou, Sheng, et al.
Publicado: (2025)
StableMoFusion: Towards Robust and Efficient Diffusion-based Motion Generation Framework
por: Huang, Yiheng, et al.
Publicado: (2024)
por: Huang, Yiheng, et al.
Publicado: (2024)
PixelBoost: Leveraging Brownian Motion for Realistic-Image Super-Resolution
por: Mishra, Aradhana, et al.
Publicado: (2025)
por: Mishra, Aradhana, et al.
Publicado: (2025)
Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning
por: Li, Shenshen, et al.
Publicado: (2025)
por: Li, Shenshen, et al.
Publicado: (2025)
ReactDiff: Latent Diffusion for Facial Reaction Generation
por: Li, Jiaming, et al.
Publicado: (2025)
por: Li, Jiaming, et al.
Publicado: (2025)
SpecFLASH: A Latent-Guided Semi-autoregressive Speculative Decoding Framework for Efficient Multimodal Generation
por: Wang, Zihua, et al.
Publicado: (2025)
por: Wang, Zihua, et al.
Publicado: (2025)
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
por: Lan, Xing, et al.
Publicado: (2024)
por: Lan, Xing, et al.
Publicado: (2024)
Towards Realistic Low-Light Image Enhancement via ISP Driven Data Modeling
por: Wang, Zhihua, et al.
Publicado: (2025)
por: Wang, Zhihua, et al.
Publicado: (2025)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
por: Yang, Shuyu, et al.
Publicado: (2024)
por: Yang, Shuyu, et al.
Publicado: (2024)
Parameter-Efficient Subspace Decoupling ViT for Mitigating Multi-Task Negative Transfer in Histological Scoring
por: Huang, Youhan, et al.
Publicado: (2026)
por: Huang, Youhan, et al.
Publicado: (2026)
Generating Attribute-Aware Human Motions from Textual Prompt
por: Wang, Xinghan, et al.
Publicado: (2025)
por: Wang, Xinghan, et al.
Publicado: (2025)
CATRF: Codec-Adaptive TriPlane Radiance Fields for Volumetric Content Delivery
por: Chen, Tung-I, et al.
Publicado: (2026)
por: Chen, Tung-I, et al.
Publicado: (2026)
ForestHG-Trace: Traceable Long-Horizon Ecological Reasoning over Large-Scale Forest Scenes
por: Cheng, Zihang, et al.
Publicado: (2026)
por: Cheng, Zihang, et al.
Publicado: (2026)
PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks
por: Wu, Jianyu, et al.
Publicado: (2025)
por: Wu, Jianyu, et al.
Publicado: (2025)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
por: Shi, Haoyuan, et al.
Publicado: (2026)
por: Shi, Haoyuan, et al.
Publicado: (2026)
FakingRecipe: Detecting Fake News on Short Video Platforms from the Perspective of Creative Process
por: Bu, Yuyan, et al.
Publicado: (2024)
por: Bu, Yuyan, et al.
Publicado: (2024)
SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas
por: Ma, Chenghao, et al.
Publicado: (2025)
por: Ma, Chenghao, et al.
Publicado: (2025)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Ejemplares similares
-
Diversity-Guided MLP Reduction for Efficient Large Vision Transformers
por: Shen, Chengchao, et al.
Publicado: (2025) -
PointLoRA: Low-Rank Adaptation with Token Selection for Point Cloud Learning
por: Wang, Song, et al.
Publicado: (2025) -
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025) -
Context and Pixel Aware Large Language Model for Video Quality Assessment
por: Wen, Wen, et al.
Publicado: (2025) -
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
por: Xiao, Yicheng, et al.
Publicado: (2025)