R2SM: Referring and Reasoning for Selective Masks
Fuente:
arXiv
Salvato in:
| Autori principali: | Shih, Yu-Lin, Tai, Wei-En, Sun, Cheng, Wang, Yu-Chiang Frank, Chen, Hwann-Tzong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Segment Anything, Even Occluded
di: Tai, Wei-En, et al.
Pubblicazione: (2025)
di: Tai, Wei-En, et al.
Pubblicazione: (2025)
EigenGS Representation: From Eigenspace to Gaussian Image Space
di: Tai, Lo-Wei, et al.
Pubblicazione: (2025)
di: Tai, Lo-Wei, et al.
Pubblicazione: (2025)
Sparse2DGS: Sparse-View Surface Reconstruction using 2D Gaussian Splatting with Dense Point Cloud
di: Takama, Natsuki, et al.
Pubblicazione: (2025)
di: Takama, Natsuki, et al.
Pubblicazione: (2025)
ErpGS: Equirectangular Image Rendering enhanced with 3D Gaussian Regularization
di: Ito, Shintaro, et al.
Pubblicazione: (2025)
di: Ito, Shintaro, et al.
Pubblicazione: (2025)
OB3D: A New Dataset for Benchmarking Omnidirectional 3D Reconstruction Using Blender
di: Ito, Shintaro, et al.
Pubblicazione: (2025)
di: Ito, Shintaro, et al.
Pubblicazione: (2025)
TPA3D: Triplane Attention for Fast Text-to-3D Generation
di: Wu, Bin-Shih, et al.
Pubblicazione: (2023)
di: Wu, Bin-Shih, et al.
Pubblicazione: (2023)
Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning
di: Liu, Shih-Wen, et al.
Pubblicazione: (2025)
di: Liu, Shih-Wen, et al.
Pubblicazione: (2025)
Data-Efficient 3D Visual Grounding via Order-Aware Referring
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
Select and Distill: Selective Dual-Teacher Knowledge Transfer for Continual Learning on Vision-Language Models
di: Yu, Yu-Chu, et al.
Pubblicazione: (2024)
di: Yu, Yu-Chu, et al.
Pubblicazione: (2024)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
Frequency Switching Mechanism for Parameter-E!cient Multi-Task Learning
di: Liu, Shih-Wen, et al.
Pubblicazione: (2026)
di: Liu, Shih-Wen, et al.
Pubblicazione: (2026)
ReXTime: A Benchmark Suite for Reasoning-Across-Time in Videos
di: Chen, Jr-Jen, et al.
Pubblicazione: (2024)
di: Chen, Jr-Jen, et al.
Pubblicazione: (2024)
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
di: Huang, Sheng-Yu, et al.
Pubblicazione: (2026)
di: Huang, Sheng-Yu, et al.
Pubblicazione: (2026)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
From Prototypes to General Distributions: An Efficient Curriculum for Masked Image Modeling
di: Lin, Jinhong, et al.
Pubblicazione: (2024)
di: Lin, Jinhong, et al.
Pubblicazione: (2024)
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
di: Lin, Ci-Siang, et al.
Pubblicazione: (2024)
di: Lin, Ci-Siang, et al.
Pubblicazione: (2024)
ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking
di: Chen, Sijia, et al.
Pubblicazione: (2026)
di: Chen, Sijia, et al.
Pubblicazione: (2026)
Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval
di: Chu, Xuangeng, et al.
Pubblicazione: (2026)
di: Chu, Xuangeng, et al.
Pubblicazione: (2026)
VISTA: Validation-Guided Integration of Spatial and Temporal Foundation Models with Anatomical Decoding for Rare-Pathology VCE Event Detection
di: Qiu, Bo-Cheng, et al.
Pubblicazione: (2026)
di: Qiu, Bo-Cheng, et al.
Pubblicazione: (2026)
Cross-View Referring Multi-Object Tracking
di: Chen, Sijia, et al.
Pubblicazione: (2024)
di: Chen, Sijia, et al.
Pubblicazione: (2024)
ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking
di: Chen, Sijia, et al.
Pubblicazione: (2025)
di: Chen, Sijia, et al.
Pubblicazione: (2025)
Toward Scene Graph and Layout Guided Complex 3D Scene Generation
di: Huang, Yu-Hsiang, et al.
Pubblicazione: (2024)
di: Huang, Yu-Hsiang, et al.
Pubblicazione: (2024)
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2025)
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2025)
CANDLE: Illumination-Invariant Semantic Priors for Color Ambient Lighting Normalization
di: Jian, Rong-Lin, et al.
Pubblicazione: (2026)
di: Jian, Rong-Lin, et al.
Pubblicazione: (2026)
STEC: A Reference-Free Spatio-Temporal Entropy Coverage Metric for Evaluating Sampled Video Frames
di: Lin, Shih-Yao
Pubblicazione: (2026)
di: Lin, Shih-Yao
Pubblicazione: (2026)
ASSR-NeRF: Arbitrary-Scale Super-Resolution on Voxel Grid for High-Quality Radiance Fields Reconstruction
di: Huang, Ding-Jiun, et al.
Pubblicazione: (2024)
di: Huang, Ding-Jiun, et al.
Pubblicazione: (2024)
MV-SAM: Multi-view Promptable Segmentation using Pointmap Guidance
di: Jeong, Yoonwoo, et al.
Pubblicazione: (2026)
di: Jeong, Yoonwoo, et al.
Pubblicazione: (2026)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
Sparse Voxels Rasterization: Real-time High-fidelity Radiance Field Rendering
di: Sun, Cheng, et al.
Pubblicazione: (2024)
di: Sun, Cheng, et al.
Pubblicazione: (2024)
ReBaR: Reference-Based Reasoning for Robust Pose Estimation from Monocular Images
di: Cheng, Yongkang, et al.
Pubblicazione: (2023)
di: Cheng, Yongkang, et al.
Pubblicazione: (2023)
Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding Registration
di: Jun-Seong, Kim, et al.
Pubblicazione: (2025)
di: Jun-Seong, Kim, et al.
Pubblicazione: (2025)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking
di: Yu, Yanqiu, et al.
Pubblicazione: (2026)
di: Yu, Yanqiu, et al.
Pubblicazione: (2026)
Advancing Structured Priors for Sparse-Voxel Surface Reconstruction
di: Chi, Ting-Hsun, et al.
Pubblicazione: (2026)
di: Chi, Ting-Hsun, et al.
Pubblicazione: (2026)
LongSplat: Robust Unposed 3D Gaussian Splatting for Casual Long Videos
di: Lin, Chin-Yang, et al.
Pubblicazione: (2025)
di: Lin, Chin-Yang, et al.
Pubblicazione: (2025)
Mask as Supervision: Leveraging Unified Mask Information for Unsupervised 3D Pose Estimation
di: Yang, Yuchen, et al.
Pubblicazione: (2023)
di: Yang, Yuchen, et al.
Pubblicazione: (2023)
DoRA: Weight-Decomposed Low-Rank Adaptation
di: Liu, Shih-Yang, et al.
Pubblicazione: (2024)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2024)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
di: Huang, Tai-Ming, et al.
Pubblicazione: (2025)
di: Huang, Tai-Ming, et al.
Pubblicazione: (2025)
3AM: 3egment Anything with Geometric Consistency in Videos
di: Sun, Yang-Che, et al.
Pubblicazione: (2026)
di: Sun, Yang-Che, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Segment Anything, Even Occluded
di: Tai, Wei-En, et al.
Pubblicazione: (2025) -
EigenGS Representation: From Eigenspace to Gaussian Image Space
di: Tai, Lo-Wei, et al.
Pubblicazione: (2025) -
Sparse2DGS: Sparse-View Surface Reconstruction using 2D Gaussian Splatting with Dense Point Cloud
di: Takama, Natsuki, et al.
Pubblicazione: (2025) -
ErpGS: Equirectangular Image Rendering enhanced with 3D Gaussian Regularization
di: Ito, Shintaro, et al.
Pubblicazione: (2025) -
OB3D: A New Dataset for Benchmarking Omnidirectional 3D Reconstruction Using Blender
di: Ito, Shintaro, et al.
Pubblicazione: (2025)