Image Difference Grounding with Natural Language
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wenxuan, Zhao, Zijia, Zhang, Yisi, Tang, Yepeng, Hu, Erdong, Wang, Xinlong, Liu, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Literal Descriptions: Understanding and Locating Open-World Objects Aligned with Human Intentions
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities
di: Liu, Jing, et al.
Pubblicazione: (2025)
di: Liu, Jing, et al.
Pubblicazione: (2025)
OneDiff: A Generalist Model for Image Difference Captioning
di: Hu, Erdong, et al.
Pubblicazione: (2024)
di: Hu, Erdong, et al.
Pubblicazione: (2024)
Diffusion Feedback Helps CLIP See Better
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation
di: Yue, Tongtian, et al.
Pubblicazione: (2025)
di: Yue, Tongtian, et al.
Pubblicazione: (2025)
ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval
di: Zhao, Zijia, et al.
Pubblicazione: (2024)
di: Zhao, Zijia, et al.
Pubblicazione: (2024)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
EAVL: Explicitly Align Vision and Language for Referring Image Segmentation
di: Yan, Yichen, et al.
Pubblicazione: (2023)
di: Yan, Yichen, et al.
Pubblicazione: (2023)
The Instance-centric Transformer for the RVOS Track of LSVOS Challenge: 3rd Place Solution
di: Cao, Bin, et al.
Pubblicazione: (2024)
di: Cao, Bin, et al.
Pubblicazione: (2024)
End-to-End Vision Tokenizer Tuning
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
Unified Vision-Language-Action Model
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
StyleMamba : State Space Model for Efficient Text-driven Image Style Transfer
di: Wang, Zijia, et al.
Pubblicazione: (2024)
di: Wang, Zijia, et al.
Pubblicazione: (2024)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
di: Zheng, Henry, et al.
Pubblicazione: (2025)
di: Zheng, Henry, et al.
Pubblicazione: (2025)
Topology-preserving Adversarial Training for Alleviating Natural Accuracy Degradation
di: Mi, Xiaoyue, et al.
Pubblicazione: (2023)
di: Mi, Xiaoyue, et al.
Pubblicazione: (2023)
2nd Place Solution for MeViS Track in CVPR 2024 PVUW Workshop: Motion Expression guided Video Segmentation
di: Cao, Bin, et al.
Pubblicazione: (2024)
di: Cao, Bin, et al.
Pubblicazione: (2024)
Adaptive FSS: A Novel Few-Shot Segmentation Framework via Prototype Enhancement
di: Wang, Jing, et al.
Pubblicazione: (2023)
di: Wang, Jing, et al.
Pubblicazione: (2023)
Motion-Enhanced Nonlocal Similarity Implicit Neural Representation for Infrared Dim and Small Target Detection
di: Liu, Pei, et al.
Pubblicazione: (2025)
di: Liu, Pei, et al.
Pubblicazione: (2025)
Continuous Representation Methods, Theories, and Applications: An Overview and Perspectives
di: Luo, Yisi, et al.
Pubblicazione: (2025)
di: Luo, Yisi, et al.
Pubblicazione: (2025)
Describing Differences in Image Sets with Natural Language
di: Dunlap, Lisa, et al.
Pubblicazione: (2023)
di: Dunlap, Lisa, et al.
Pubblicazione: (2023)
Language-Grounded Multi-Domain Image Translation via Semantic Difference Guidance
di: Ryu, Jongwon, et al.
Pubblicazione: (2026)
di: Ryu, Jongwon, et al.
Pubblicazione: (2026)
Diffusion for Natural Image Matting
di: Hu, Yihan, et al.
Pubblicazione: (2023)
di: Hu, Yihan, et al.
Pubblicazione: (2023)
A Simple Image Segmentation Framework via In-Context Examples
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
di: Chen, Zheng, et al.
Pubblicazione: (2024)
di: Chen, Zheng, et al.
Pubblicazione: (2024)
Multi-Scale Diffusion: Enhancing Spatial Layout in High-Resolution Panoramic Image Generation
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2024)
MLIP: Efficient Multi-Perspective Language-Image Pretraining with Exhaustive Data Utilization
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
GroundingBooth: Grounding Text-to-Image Customization
di: Xiong, Zhexiao, et al.
Pubblicazione: (2024)
di: Xiong, Zhexiao, et al.
Pubblicazione: (2024)
MIFNet: Learning Modality-Invariant Features for Generalizable Multimodal Image Matching
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
Eyes on Target: Gaze-Aware Object Detection in Egocentric Video
di: Lall, Vishakha, et al.
Pubblicazione: (2025)
di: Lall, Vishakha, et al.
Pubblicazione: (2025)
The Bayesian Method of Tensor Networks
di: Guo, Erdong, et al.
Pubblicazione: (2021)
di: Guo, Erdong, et al.
Pubblicazione: (2021)
On the Robustness of GUI Grounding Models Against Image Attacks
di: Zhao, Haoren, et al.
Pubblicazione: (2025)
di: Zhao, Haoren, et al.
Pubblicazione: (2025)
Referring Remote Sensing Image Segmentation via Bidirectional Alignment Guided Joint Prediction
di: Zhang, Tianxiang, et al.
Pubblicazione: (2025)
di: Zhang, Tianxiang, et al.
Pubblicazione: (2025)
Neural Operator-Grounded Continuous Tensor Function Representation and Its Applications
di: Su, Ruoyang, et al.
Pubblicazione: (2026)
di: Su, Ruoyang, et al.
Pubblicazione: (2026)
Grounding Everything in Tokens for Multimodal Large Language Models
di: Ren, Xiangxuan, et al.
Pubblicazione: (2025)
di: Ren, Xiangxuan, et al.
Pubblicazione: (2025)
SeCap: Self-Calibrating and Adaptive Prompts for Cross-view Person Re-Identification in Aerial-Ground Networks
di: Wang, Shining, et al.
Pubblicazione: (2025)
di: Wang, Shining, et al.
Pubblicazione: (2025)
Tokenize Anything via Prompting
di: Pan, Ting, et al.
Pubblicazione: (2023)
di: Pan, Ting, et al.
Pubblicazione: (2023)
Dual Structure-Aware Image Filterings for Semi-supervised Medical Image Segmentation
di: Gu, Yuliang, et al.
Pubblicazione: (2023)
di: Gu, Yuliang, et al.
Pubblicazione: (2023)
ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
di: Guo, Yuxiang, et al.
Pubblicazione: (2025)
di: Guo, Yuxiang, et al.
Pubblicazione: (2025)
Position-Guided Prompt Learning for Anomaly Detection in Chest X-Rays
di: Sun, Zhichao, et al.
Pubblicazione: (2024)
di: Sun, Zhichao, et al.
Pubblicazione: (2024)
EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models
di: Bai, Yu, et al.
Pubblicazione: (2026)
di: Bai, Yu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Beyond Literal Descriptions: Understanding and Locating Open-World Objects Aligned with Human Intentions
di: Wang, Wenxuan, et al.
Pubblicazione: (2024) -
Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities
di: Liu, Jing, et al.
Pubblicazione: (2025) -
OneDiff: A Generalist Model for Image Difference Captioning
di: Hu, Erdong, et al.
Pubblicazione: (2024) -
Diffusion Feedback Helps CLIP See Better
di: Wang, Wenxuan, et al.
Pubblicazione: (2024) -
Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)