Think Before You Segment: High-Quality Reasoning Segmentation with GPT Chain of Thoughts
Fuente:
arXiv
Salvato in:
| Autori principali: | Kao, Shiu-hong, Tai, Yu-Wing, Tang, Chi-Keung |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction
di: Kao, Shiu-hong, et al.
Pubblicazione: (2026)
di: Kao, Shiu-hong, et al.
Pubblicazione: (2026)
Deceptive-NeRF/3DGS: Diffusion-Generated Pseudo-Observations for High-Quality Sparse-View Reconstruction
di: Liu, Xinhang, et al.
Pubblicazione: (2023)
di: Liu, Xinhang, et al.
Pubblicazione: (2023)
InceptionHuman: Controllable Prompt-to-NeRF for Photorealistic 3D Human Generation
di: Kao, Shiu-hong, et al.
Pubblicazione: (2023)
di: Kao, Shiu-hong, et al.
Pubblicazione: (2023)
SANeRF-HQ: Segment Anything for NeRF in High Quality
di: Liu, Yichen, et al.
Pubblicazione: (2023)
di: Liu, Yichen, et al.
Pubblicazione: (2023)
UVRM: A Scalable 3D Reconstruction Model from Unposed Videos
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
FED-NeRF: Achieve High 3D Consistency and Temporal Coherence for Face Video Editing on Dynamic NeRF
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
di: Gong, Sitong, et al.
Pubblicazione: (2025)
di: Gong, Sitong, et al.
Pubblicazione: (2025)
ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation
di: Ao, Yuzhuo, et al.
Pubblicazione: (2026)
di: Ao, Yuzhuo, et al.
Pubblicazione: (2026)
Multimodal Generation of Animatable 3D Human Models with AvatarForge
di: Liu, Xinhang, et al.
Pubblicazione: (2025)
di: Liu, Xinhang, et al.
Pubblicazione: (2025)
ChatCam: Empowering Camera Control through Conversational AI
di: Liu, Xinhang, et al.
Pubblicazione: (2024)
di: Liu, Xinhang, et al.
Pubblicazione: (2024)
Agentic 3D Scene Generation with Spatially Contextualized VLMs
di: Liu, Xinhang, et al.
Pubblicazione: (2025)
di: Liu, Xinhang, et al.
Pubblicazione: (2025)
ReelWave: Multi-Agentic Movie Sound Generation through Multimodal LLM Conversation
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
WorldCraft: Photo-Realistic 3D World Creation and Customization via LLM Agents
di: Liu, Xinhang, et al.
Pubblicazione: (2025)
di: Liu, Xinhang, et al.
Pubblicazione: (2025)
Beyond and Free from Diffusion: Invertible Guided Consistency Training
di: Hsu, Chia-Hong, et al.
Pubblicazione: (2025)
di: Hsu, Chia-Hong, et al.
Pubblicazione: (2025)
StableKD: Breaking Inter-block Optimization Entanglement for Stable Knowledge Distillation
di: Kao, Shiu-hong, et al.
Pubblicazione: (2023)
di: Kao, Shiu-hong, et al.
Pubblicazione: (2023)
Navigating Motion Agents in Dynamic and Cluttered Environments through LLM Reasoning
di: Zhao, Yubo, et al.
Pubblicazione: (2025)
di: Zhao, Yubo, et al.
Pubblicazione: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
di: Zhang, Jialiang, et al.
Pubblicazione: (2026)
di: Zhang, Jialiang, et al.
Pubblicazione: (2026)
Inpaint4DNeRF: Promptable Spatio-Temporal NeRF Inpainting with Generative Diffusion Models
di: Jiang, Han, et al.
Pubblicazione: (2023)
di: Jiang, Han, et al.
Pubblicazione: (2023)
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
di: Zhou, Jinxing, et al.
Pubblicazione: (2025)
di: Zhou, Jinxing, et al.
Pubblicazione: (2025)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
di: Wen, Junwei, et al.
Pubblicazione: (2026)
di: Wen, Junwei, et al.
Pubblicazione: (2026)
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
DragVideo: Interactive Drag-style Video Editing
di: Deng, Yufan, et al.
Pubblicazione: (2023)
di: Deng, Yufan, et al.
Pubblicazione: (2023)
Motion-Agent: A Conversational Framework for Human Motion Generation with LLMs
di: Wu, Qi, et al.
Pubblicazione: (2024)
di: Wu, Qi, et al.
Pubblicazione: (2024)
Think Before You Move: Latent Motion Reasoning for Text-to-Motion Generation
di: Qian, Yijie, et al.
Pubblicazione: (2025)
di: Qian, Yijie, et al.
Pubblicazione: (2025)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
di: Lu, Yi, et al.
Pubblicazione: (2025)
di: Lu, Yi, et al.
Pubblicazione: (2025)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
di: Gu, Jiawei, et al.
Pubblicazione: (2025)
di: Gu, Jiawei, et al.
Pubblicazione: (2025)
FreeFly-Thinking : Aligning Chain-of-Thought Reasoning with Continuous UAV Navigation
di: Zhou, Jiaxu, et al.
Pubblicazione: (2026)
di: Zhou, Jiaxu, et al.
Pubblicazione: (2026)
SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents
di: Huang-Menders, Alexander, et al.
Pubblicazione: (2025)
di: Huang-Menders, Alexander, et al.
Pubblicazione: (2025)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
di: Lu, Zhenyu, et al.
Pubblicazione: (2025)
di: Lu, Zhenyu, et al.
Pubblicazione: (2025)
PS-ReID: Advancing Person Re-Identification and Precise Segmentation with Multimodal Retrieval
di: Yan, Jincheng, et al.
Pubblicazione: (2025)
di: Yan, Jincheng, et al.
Pubblicazione: (2025)
ArgusCogito: Chain-of-Thought for Cross-Modal Synergy and Omnidirectional Reasoning in Camouflaged Object Segmentation
di: Tan, Jianwen, et al.
Pubblicazione: (2025)
di: Tan, Jianwen, et al.
Pubblicazione: (2025)
CoT-Segmenter: Enhancing OOD Detection in Dense Road Scenes via Chain-of-Thought Reasoning
di: Song, Jeonghyo, et al.
Pubblicazione: (2025)
di: Song, Jeonghyo, et al.
Pubblicazione: (2025)
VP-LLM: Text-Driven 3D Volume Completion with Large Language Models through Patchification
di: Liu, Jianmeng, et al.
Pubblicazione: (2024)
di: Liu, Jianmeng, et al.
Pubblicazione: (2024)
Trace Anything: Representing Any Video in 4D via Trajectory Fields
di: Liu, Xinhang, et al.
Pubblicazione: (2025)
di: Liu, Xinhang, et al.
Pubblicazione: (2025)
Efficient Reasoning via Thought Compression for Language Segmentation
di: Zhou, Qing, et al.
Pubblicazione: (2026)
di: Zhou, Qing, et al.
Pubblicazione: (2026)
Think Before You Diffuse: Infusing Physical Rules into Video Diffusion
di: Zhang, Ke, et al.
Pubblicazione: (2025)
di: Zhang, Ke, et al.
Pubblicazione: (2025)
UltraGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
di: Zhang, Yuyao, et al.
Pubblicazione: (2025)
di: Zhang, Yuyao, et al.
Pubblicazione: (2025)
StreamGS: Online Generalizable Gaussian Splatting Reconstruction for Unposed Image Streams
di: LI, Yang, et al.
Pubblicazione: (2025)
di: LI, Yang, et al.
Pubblicazione: (2025)
Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
di: Guo, Yuchen, et al.
Pubblicazione: (2026)
di: Guo, Yuchen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025) -
CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction
di: Kao, Shiu-hong, et al.
Pubblicazione: (2026) -
Deceptive-NeRF/3DGS: Diffusion-Generated Pseudo-Observations for High-Quality Sparse-View Reconstruction
di: Liu, Xinhang, et al.
Pubblicazione: (2023) -
InceptionHuman: Controllable Prompt-to-NeRF for Photorealistic 3D Human Generation
di: Kao, Shiu-hong, et al.
Pubblicazione: (2023) -
SANeRF-HQ: Segment Anything for NeRF in High Quality
di: Liu, Yichen, et al.
Pubblicazione: (2023)