CIRCLED: A Multi-turn CIR Dataset with Consistent Dialogues across Domains
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Takeda, Tomohisa, Lin, Yu-Chieh, Nozawa, Yuji, Ng, Youyang, Torii, Osamu, Matsui, Yusuke |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Revisiting Relevance Feedback for CLIP-based Interactive Image Retrieval
par: Nara, Ryoya, et autres
Publié: (2024)
par: Nara, Ryoya, et autres
Publié: (2024)
Prompt-Guided Attention Head Selection for Focus-Oriented Image Retrieval
par: Nozawa, Yuji, et autres
Publié: (2025)
par: Nozawa, Yuji, et autres
Publié: (2025)
Improving Image Clustering with Artifacts Attenuation via Inference-Time Attention Engineering
par: Nakamura, Kazumoto, et autres
Publié: (2024)
par: Nakamura, Kazumoto, et autres
Publié: (2024)
Manga109Dialog: A Large-scale Dialogue Dataset for Comics Speaker Detection
par: Li, Yingxuan, et autres
Publié: (2023)
par: Li, Yingxuan, et autres
Publié: (2023)
SVGEditBench: A Benchmark Dataset for Quantitative Assessment of LLM's SVG Editing Capabilities
par: Nishina, Kunato, et autres
Publié: (2024)
par: Nishina, Kunato, et autres
Publié: (2024)
Multi-turn Consistent Image Editing
par: Zhou, Zijun, et autres
Publié: (2025)
par: Zhou, Zijun, et autres
Publié: (2025)
ZoDi: Zero-Shot Domain Adaptation with Diffusion-Based Image Transfer
par: Azuma, Hiroki, et autres
Publié: (2024)
par: Azuma, Hiroki, et autres
Publié: (2024)
EUFCC-CIR: a Composed Image Retrieval Dataset for GLAM Collections
par: Net, Francesc, et autres
Publié: (2024)
par: Net, Francesc, et autres
Publié: (2024)
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
par: Huang, Minbin, et autres
Publié: (2024)
par: Huang, Minbin, et autres
Publié: (2024)
High-Frequency Anti-DreamBooth: Robust Defense against Personalized Image Synthesis
par: Onikubo, Takuto, et autres
Publié: (2024)
par: Onikubo, Takuto, et autres
Publié: (2024)
RouteExtract: A Modular Pipeline for Extracting Routes from Paper Maps
par: Kremser, Bjoern, et autres
Publié: (2025)
par: Kremser, Bjoern, et autres
Publié: (2025)
Adversarial Doodles: Interpretable and Human-drawable Attacks Provide Describable Insights
par: Nara, Ryoya, et autres
Publié: (2023)
par: Nara, Ryoya, et autres
Publié: (2023)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
par: Tong, Wenwen, et autres
Publié: (2025)
par: Tong, Wenwen, et autres
Publié: (2025)
A Closer Look at Cross-Domain Few-Shot Object Detection: Fine-Tuning Matters and Parallel Decoder Helps
par: Yu, Xuanlong, et autres
Publié: (2026)
par: Yu, Xuanlong, et autres
Publié: (2026)
Rethinking Sparse Lexical Representations for Image Retrieval in the Age of Rising Multi-Modal Large Language Models
par: Nakata, Kengo, et autres
Publié: (2024)
par: Nakata, Kengo, et autres
Publié: (2024)
AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation
par: Cheng, Junhao, et autres
Publié: (2024)
par: Cheng, Junhao, et autres
Publié: (2024)
TheaterGen: Character Management with LLM for Consistent Multi-turn Image Generation
par: Cheng, Junhao, et autres
Publié: (2024)
par: Cheng, Junhao, et autres
Publié: (2024)
LotusFilter: Fast Diverse Nearest Neighbor Search via a Learned Cutoff Table
par: Matsui, Yusuke
Publié: (2025)
par: Matsui, Yusuke
Publié: (2025)
Leadership Assessment in Pediatric Intensive Care Unit Team Training
par: Ouyang, Liangyang, et autres
Publié: (2025)
par: Ouyang, Liangyang, et autres
Publié: (2025)
IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval
par: Han, Ning, et autres
Publié: (2025)
par: Han, Ning, et autres
Publié: (2025)
Contrastive Bi-Projector for Unsupervised Domain Adaption
par: Huang, Lin-Chieh, et autres
Publié: (2023)
par: Huang, Lin-Chieh, et autres
Publié: (2023)
DeliCIR: Deliberative Test-Time Evolutionary Hierarchical Multi-Agents for Composed Image Retrieval
par: Pei, Xingtian, et autres
Publié: (2026)
par: Pei, Xingtian, et autres
Publié: (2026)
Noisy Label Refinement with Semantically Reliable Synthetic Images
par: Li, Yingxuan, et autres
Publié: (2025)
par: Li, Yingxuan, et autres
Publié: (2025)
PromptCIR: Blind Compressed Image Restoration with Prompt Learning
par: Li, Bingchen, et autres
Publié: (2024)
par: Li, Bingchen, et autres
Publié: (2024)
WRF4CIR: Weight-Regularized Fine-Tuning Network for Composed Image Retrieval
par: Xu, Yizhuo, et autres
Publié: (2026)
par: Xu, Yizhuo, et autres
Publié: (2026)
Interaction-Consistent Object Removal via MLLM-Based Reasoning
par: Huang, Ching-Kai, et autres
Publié: (2026)
par: Huang, Ching-Kai, et autres
Publié: (2026)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
par: Lin, Weihuang, et autres
Publié: (2025)
par: Lin, Weihuang, et autres
Publié: (2025)
NCL-CIR: Noise-aware Contrastive Learning for Composed Image Retrieval
par: Gao, Peng, et autres
Publié: (2025)
par: Gao, Peng, et autres
Publié: (2025)
HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels
par: Jiang, Yingying, et autres
Publié: (2024)
par: Jiang, Yingying, et autres
Publié: (2024)
Revisiting Invariant Learning for Out-of-Domain Generalization on Multi-Site Mammogram Datasets
par: Vo, Hung Q., et autres
Publié: (2025)
par: Vo, Hung Q., et autres
Publié: (2025)
Region-Wise Correspondence Prediction between Manga Line Art Images
par: Li, Yingxuan, et autres
Publié: (2025)
par: Li, Yingxuan, et autres
Publié: (2025)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
par: Yang, Wenhao, et autres
Publié: (2025)
par: Yang, Wenhao, et autres
Publié: (2025)
Generating Dialogues from Egocentric Instructional Videos for Task Assistance: Dataset, Method and Benchmark
par: Aggarwal, Lavisha, et autres
Publié: (2025)
par: Aggarwal, Lavisha, et autres
Publié: (2025)
A Multi-View Consistency Framework with Semi-Supervised Domain Adaptation
par: Hong, Yuting, et autres
Publié: (2026)
par: Hong, Yuting, et autres
Publié: (2026)
Multi-modal Motion Prediction using Temporal Ensembling with Learning-based Aggregation
par: Hong, Kai-Yin, et autres
Publié: (2024)
par: Hong, Kai-Yin, et autres
Publié: (2024)
CRAG-MM: Multi-modal Multi-turn Comprehensive RAG Benchmark
par: Wang, Jiaqi, et autres
Publié: (2025)
par: Wang, Jiaqi, et autres
Publié: (2025)
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
par: Cai, Weitong, et autres
Publié: (2024)
par: Cai, Weitong, et autres
Publié: (2024)
DM$^3$Net: Dual-Camera Super-Resolution via Domain Modulation and Multi-scale Matching
par: Guan, Cong, et autres
Publié: (2025)
par: Guan, Cong, et autres
Publié: (2025)
Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning
par: Aoshima, Takehiro, et autres
Publié: (2025)
par: Aoshima, Takehiro, et autres
Publié: (2025)
Exploring Semantic Consistency and Style Diversity for Domain Generalized Semantic Segmentation
par: Niu, Hongwei, et autres
Publié: (2024)
par: Niu, Hongwei, et autres
Publié: (2024)
Documents similaires
-
Revisiting Relevance Feedback for CLIP-based Interactive Image Retrieval
par: Nara, Ryoya, et autres
Publié: (2024) -
Prompt-Guided Attention Head Selection for Focus-Oriented Image Retrieval
par: Nozawa, Yuji, et autres
Publié: (2025) -
Improving Image Clustering with Artifacts Attenuation via Inference-Time Attention Engineering
par: Nakamura, Kazumoto, et autres
Publié: (2024) -
Manga109Dialog: A Large-scale Dialogue Dataset for Comics Speaker Detection
par: Li, Yingxuan, et autres
Publié: (2023) -
SVGEditBench: A Benchmark Dataset for Quantitative Assessment of LLM's SVG Editing Capabilities
par: Nishina, Kunato, et autres
Publié: (2024)