Reasoning to Attend: Try to Understand How <SEG> Token Works
Fuente:
arXiv
Salvato in:
| Autori principali: | Qian, Rui, Yin, Xin, Dou, Dejing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UGround: Towards Unified Visual Grounding with Unrolled Transformers
di: Qian, Rui, et al.
Pubblicazione: (2025)
di: Qian, Rui, et al.
Pubblicazione: (2025)
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
di: Qian, Rui, et al.
Pubblicazione: (2026)
di: Qian, Rui, et al.
Pubblicazione: (2026)
Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
di: Fang, Haipeng, et al.
Pubblicazione: (2025)
di: Fang, Haipeng, et al.
Pubblicazione: (2025)
Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation
di: Chen, Ruoyu, et al.
Pubblicazione: (2025)
di: Chen, Ruoyu, et al.
Pubblicazione: (2025)
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
di: Shi, Baifeng, et al.
Pubblicazione: (2026)
di: Shi, Baifeng, et al.
Pubblicazione: (2026)
SEG-SAM: Semantic-Guided SAM for Unified Medical Image Segmentation
di: Huang, Shuangping, et al.
Pubblicazione: (2024)
di: Huang, Shuangping, et al.
Pubblicazione: (2024)
CrossVTON: Mimicking the Logic Reasoning on Cross-category Virtual Try-on guided by Tri-zone Priors
di: Luo, Donghao, et al.
Pubblicazione: (2025)
di: Luo, Donghao, et al.
Pubblicazione: (2025)
FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning
di: Chen, Haodong, et al.
Pubblicazione: (2025)
di: Chen, Haodong, et al.
Pubblicazione: (2025)
Locality-Attending Vision Transformer
di: Hajimiri, Sina, et al.
Pubblicazione: (2026)
di: Hajimiri, Sina, et al.
Pubblicazione: (2026)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
TryOn-Adapter: Efficient Fine-Grained Clothing Identity Adaptation for High-Fidelity Virtual Try-On
di: Xing, Jiazheng, et al.
Pubblicazione: (2024)
di: Xing, Jiazheng, et al.
Pubblicazione: (2024)
RankSEG-RMA: An Efficient Segmentation Algorithm via Reciprocal Moment Approximation
di: Wang, Zixun, et al.
Pubblicazione: (2025)
di: Wang, Zixun, et al.
Pubblicazione: (2025)
Token Merging via Spatiotemporal Information Mining for Surgical Video Understanding
di: Jiang, Xixi, et al.
Pubblicazione: (2025)
di: Jiang, Xixi, et al.
Pubblicazione: (2025)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
EarlyTom: Early Token Compression Completes Fast Video Understanding
di: Wang, Hesong, et al.
Pubblicazione: (2026)
di: Wang, Hesong, et al.
Pubblicazione: (2026)
TAMM: TriAdapter Multi-Modal Learning for 3D Shape Understanding
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
First RAG, Second SEG: A Training-Free Paradigm for Camouflaged Object Detection
di: Liu, Wutao, et al.
Pubblicazione: (2025)
di: Liu, Wutao, et al.
Pubblicazione: (2025)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning
di: Miao, Deshui, et al.
Pubblicazione: (2026)
di: Miao, Deshui, et al.
Pubblicazione: (2026)
TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
di: Mao, Weian, et al.
Pubblicazione: (2026)
di: Mao, Weian, et al.
Pubblicazione: (2026)
OOD-SEG: Exploiting out-of-distribution detection techniques for learning image segmentation from sparse multi-class positive-only annotations
di: Wang, Junwen, et al.
Pubblicazione: (2024)
di: Wang, Junwen, et al.
Pubblicazione: (2024)
Shape-Guided Clothing Warping for Virtual Try-On
di: Han, Xiaoyu, et al.
Pubblicazione: (2025)
di: Han, Xiaoyu, et al.
Pubblicazione: (2025)
Try-On-Adapter: A Simple and Flexible Try-On Paradigm
di: Guo, Hanzhong, et al.
Pubblicazione: (2024)
di: Guo, Hanzhong, et al.
Pubblicazione: (2024)
OmniTry: Virtual Try-On Anything without Masks
di: Feng, Yutong, et al.
Pubblicazione: (2025)
di: Feng, Yutong, et al.
Pubblicazione: (2025)
BC-MRI-SEG: A Breast Cancer MRI Tumor Segmentation Benchmark
di: Bilic, Anthony, et al.
Pubblicazione: (2024)
di: Bilic, Anthony, et al.
Pubblicazione: (2024)
Teeth-SEG: An Efficient Instance Segmentation Framework for Orthodontic Treatment based on Anthropic Prior Knowledge
di: Zou, Bo, et al.
Pubblicazione: (2024)
di: Zou, Bo, et al.
Pubblicazione: (2024)
TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task Tokenization
di: Pan, Liang, et al.
Pubblicazione: (2025)
di: Pan, Liang, et al.
Pubblicazione: (2025)
Principles of Visual Tokens for Efficient Video Understanding
di: Hao, Xinyue, et al.
Pubblicazione: (2024)
di: Hao, Xinyue, et al.
Pubblicazione: (2024)
Towards the Automatic Segmentation, Modeling and Meshing of the Aortic Vessel Tree from Multicenter Acquisitions: An Overview of the SEG.A. 2023 Segmentation of the Aorta Challenge
di: Jin, Yuan, et al.
Pubblicazione: (2025)
di: Jin, Yuan, et al.
Pubblicazione: (2025)
Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening
di: Li, Junfeng, et al.
Pubblicazione: (2026)
di: Li, Junfeng, et al.
Pubblicazione: (2026)
When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs
di: Wang, Yahong, et al.
Pubblicazione: (2025)
di: Wang, Yahong, et al.
Pubblicazione: (2025)
2D Gaussians Meet Visual Tokenizer
di: Shi, Yiang, et al.
Pubblicazione: (2025)
di: Shi, Yiang, et al.
Pubblicazione: (2025)
SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding
di: Zheng, Hongpei, et al.
Pubblicazione: (2025)
di: Zheng, Hongpei, et al.
Pubblicazione: (2025)
GlamTry: Advancing Virtual Try-On for High-End Accessories
di: Chang, Ting-Yu, et al.
Pubblicazione: (2024)
di: Chang, Ting-Yu, et al.
Pubblicazione: (2024)
Tri$^{2}$-plane: Thinking Head Avatar via Feature Pyramid
di: Song, Luchuan, et al.
Pubblicazione: (2024)
di: Song, Luchuan, et al.
Pubblicazione: (2024)
Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Prediction
di: Yin, Ruihong, et al.
Pubblicazione: (2025)
di: Yin, Ruihong, et al.
Pubblicazione: (2025)
Attend and Enrich: Enhanced Visual Prompt for Zero-Shot Learning
di: Liu, Man, et al.
Pubblicazione: (2024)
di: Liu, Man, et al.
Pubblicazione: (2024)
Video, How Do Your Tokens Merge?
di: Pollard, Sam, et al.
Pubblicazione: (2025)
di: Pollard, Sam, et al.
Pubblicazione: (2025)
Attend to what I say: Highlighting relevant content on slides
di: M, Megha Mariam K, et al.
Pubblicazione: (2026)
di: M, Megha Mariam K, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UGround: Towards Unified Visual Grounding with Unrolled Transformers
di: Qian, Rui, et al.
Pubblicazione: (2025) -
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
di: Qian, Rui, et al.
Pubblicazione: (2026) -
Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
di: Fang, Haipeng, et al.
Pubblicazione: (2025) -
Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation
di: Chen, Ruoyu, et al.
Pubblicazione: (2025) -
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
di: Shi, Baifeng, et al.
Pubblicazione: (2026)