ReSeDis: A Dataset for Referring-based Object Search across Large-Scale Image Collections
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Ziling, Zhang, Yidan, Satoh, Shin'ichi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TransRef: Multi-Scale Reference Embedding Transformer for Reference-Guided Image Inpainting
by: Liu, Taorong, et al.
Published: (2023)
by: Liu, Taorong, et al.
Published: (2023)
The Effects of Short Video-Sharing Services on Video Copy Detection
by: Yanagi, Rintaro, et al.
Published: (2024)
by: Yanagi, Rintaro, et al.
Published: (2024)
Probabilistic Online Event Downsampling
by: Girbau-Xalabarder, Andreu, et al.
Published: (2025)
by: Girbau-Xalabarder, Andreu, et al.
Published: (2025)
Foundation Model Insights and a Multi-Model Approach for Superior Fine-Grained One-shot Subset Selection
by: Wan, Zhijing, et al.
Published: (2025)
by: Wan, Zhijing, et al.
Published: (2025)
A Large-Scale Referring Remote Sensing Image Segmentation Dataset and Benchmark
by: Yang, Zhigang, et al.
Published: (2025)
by: Yang, Zhigang, et al.
Published: (2025)
Matting by Generation
by: Wang, Zhixiang, et al.
Published: (2024)
by: Wang, Zhixiang, et al.
Published: (2024)
Certified Zeroth-order Black-Box Defense with Robust UNet Denoiser
by: Verma, Astha, et al.
Published: (2023)
by: Verma, Astha, et al.
Published: (2023)
RanLayNet: A Dataset for Document Layout Detection used for Domain Adaptation and Generalization
by: Anand, Avinash, et al.
Published: (2024)
by: Anand, Avinash, et al.
Published: (2024)
SVAC: Scaling Is All You Need For Referring Video Object Segmentation
by: Zhang, Li, et al.
Published: (2025)
by: Zhang, Li, et al.
Published: (2025)
TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content
by: Anand, Avinash, et al.
Published: (2024)
by: Anand, Avinash, et al.
Published: (2024)
DisTime: Distribution-based Time Representation for Video Large Language Models
by: Zeng, Yingsen, et al.
Published: (2025)
by: Zeng, Yingsen, et al.
Published: (2025)
Fairness Without Labels: Pseudo-Balancing for Bias Mitigation in Face Gender Classification
by: Dong, Haohua, et al.
Published: (2025)
by: Dong, Haohua, et al.
Published: (2025)
Physical Adversarial Attack meets Computer Vision: A Decade Survey
by: Wei, Hui, et al.
Published: (2022)
by: Wei, Hui, et al.
Published: (2022)
UW-VOS: A Large-Scale Dataset for Underwater Video Object Segmentation
by: Zhao, Hongshen, et al.
Published: (2026)
by: Zhao, Hongshen, et al.
Published: (2026)
Ensemble Foreground Management for Unsupervised Object Discovery
by: Wu, Ziling, et al.
Published: (2025)
by: Wu, Ziling, et al.
Published: (2025)
Enhancing Small-Scale Dataset Expansion with Triplet-Connection-based Sample Re-Weighting
by: Xiang, Ting, et al.
Published: (2025)
by: Xiang, Ting, et al.
Published: (2025)
SCORP: Scene-Consistent Object Refinement via Proxy Generation and Tuning
by: Chen, Ziwei, et al.
Published: (2025)
by: Chen, Ziwei, et al.
Published: (2025)
DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models
by: Ma, Jin, et al.
Published: (2025)
by: Ma, Jin, et al.
Published: (2025)
MSVCOD:A Large-Scale Multi-Scene Dataset for Video Camouflage Object Detection
by: Gao, Shuyong, et al.
Published: (2025)
by: Gao, Shuyong, et al.
Published: (2025)
BihoT: A Large-Scale Dataset and Benchmark for Hyperspectral Camouflaged Object Tracking
by: Wang, Hanzheng, et al.
Published: (2024)
by: Wang, Hanzheng, et al.
Published: (2024)
Uplifting Table Tennis: A Robust, Real-World Application for 3D Trajectory and Spin Estimation
by: Kienzle, Daniel, et al.
Published: (2025)
by: Kienzle, Daniel, et al.
Published: (2025)
DisPlace: Discriminative Place Projections for Multi-Reference Visual Place Recognition
by: Rajani, Dhyey Manish, et al.
Published: (2026)
by: Rajani, Dhyey Manish, et al.
Published: (2026)
PAM: A Propagation-Based Model for Segmenting Any 3D Objects across Multi-Modal Medical Images
by: Chen, Zifan, et al.
Published: (2024)
by: Chen, Zifan, et al.
Published: (2024)
ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking
by: Chen, Sijia, et al.
Published: (2026)
by: Chen, Sijia, et al.
Published: (2026)
SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving
by: Embacher, Felix, et al.
Published: (2026)
by: Embacher, Felix, et al.
Published: (2026)
VC-Agent: An Interactive Agent for Customized Video Dataset Collection
by: Zhang, Yidan, et al.
Published: (2025)
by: Zhang, Yidan, et al.
Published: (2025)
4KLSDB: A Large-Scale Dataset for 4K Image Restoration and Generation
by: Zhu, Zihao, et al.
Published: (2026)
by: Zhu, Zihao, et al.
Published: (2026)
AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation
by: Jin, Woojeong, et al.
Published: (2026)
by: Jin, Woojeong, et al.
Published: (2026)
ReMamber: Referring Image Segmentation with Mamba Twister
by: Yang, Yuhuan, et al.
Published: (2024)
by: Yang, Yuhuan, et al.
Published: (2024)
ReBaR: Reference-Based Reasoning for Robust Pose Estimation from Monocular Images
by: Cheng, Yongkang, et al.
Published: (2023)
by: Cheng, Yongkang, et al.
Published: (2023)
UNOPose: Unseen Object Pose Estimation with an Unposed RGB-D Reference Image
by: Liu, Xingyu, et al.
Published: (2024)
by: Liu, Xingyu, et al.
Published: (2024)
DisEnvisioner: Disentangled and Enriched Visual Prompt for Customized Image Generation
by: He, Jing, et al.
Published: (2024)
by: He, Jing, et al.
Published: (2024)
DisPose: Disentangling Pose Guidance for Controllable Human Image Animation
by: Li, Hongxiang, et al.
Published: (2024)
by: Li, Hongxiang, et al.
Published: (2024)
Single Document Image Highlight Removal via A Large-Scale Real-World Dataset and A Location-Aware Network
by: Pan, Lu, et al.
Published: (2025)
by: Pan, Lu, et al.
Published: (2025)
ROVR-Open-Dataset: A Large-Scale Depth Dataset for Autonomous Driving
by: Guo, Xianda, et al.
Published: (2025)
by: Guo, Xianda, et al.
Published: (2025)
Large-Scale Text-to-Image Model with Inpainting is a Zero-Shot Subject-Driven Image Generator
by: Shin, Chaehun, et al.
Published: (2024)
by: Shin, Chaehun, et al.
Published: (2024)
DivShift: Exploring Domain-Specific Distribution Shifts in Large-Scale, Volunteer-Collected Biodiversity Datasets
by: Sierra, Elena, et al.
Published: (2024)
by: Sierra, Elena, et al.
Published: (2024)
VoDaSuRe: A Large-Scale Dataset Revealing Domain Shift in Volumetric Super-Resolution
by: Høeg, August Leander, et al.
Published: (2026)
by: Høeg, August Leander, et al.
Published: (2026)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
by: Lv, Weiyi, et al.
Published: (2025)
by: Lv, Weiyi, et al.
Published: (2025)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
by: Chen, Yuqing, et al.
Published: (2025)
by: Chen, Yuqing, et al.
Published: (2025)
Similar Items
-
TransRef: Multi-Scale Reference Embedding Transformer for Reference-Guided Image Inpainting
by: Liu, Taorong, et al.
Published: (2023) -
The Effects of Short Video-Sharing Services on Video Copy Detection
by: Yanagi, Rintaro, et al.
Published: (2024) -
Probabilistic Online Event Downsampling
by: Girbau-Xalabarder, Andreu, et al.
Published: (2025) -
Foundation Model Insights and a Multi-Model Approach for Superior Fine-Grained One-shot Subset Selection
by: Wan, Zhijing, et al.
Published: (2025) -
A Large-Scale Referring Remote Sensing Image Segmentation Dataset and Benchmark
by: Yang, Zhigang, et al.
Published: (2025)