Locating and Editing Figure-Ground Organization in Vision Transformers
Fuente:
arXiv
Saved in:
| Main Authors: | Arnold, Stefan, Gröbner, René |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Integrating Vision and Location with Transformers: A Multimodal Deep Learning Framework for Medical Wound Analysis
by: Mousa, Ramin, et al.
Published: (2025)
by: Mousa, Ramin, et al.
Published: (2025)
LocateEdit-Bench: A Benchmark for Instruction-Based Editing Localization
by: Wu, Shiyu, et al.
Published: (2026)
by: Wu, Shiyu, et al.
Published: (2026)
X-Edit: Exact, Explicit, and Explainable Null-Space Editing for Medical Vision Transformers
by: Liu, Yuanye, et al.
Published: (2026)
by: Liu, Yuanye, et al.
Published: (2026)
Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors
by: Guo, Lanqing, et al.
Published: (2025)
by: Guo, Lanqing, et al.
Published: (2025)
EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM
by: Nguyen, Quang, et al.
Published: (2024)
by: Nguyen, Quang, et al.
Published: (2024)
LocateBench: Evaluating the Locating Ability of Vision Language Models
by: Chiang, Ting-Rui, et al.
Published: (2024)
by: Chiang, Ting-Rui, et al.
Published: (2024)
Text Guided Image Editing with Automatic Concept Locating and Forgetting
by: Li, Jia, et al.
Published: (2024)
by: Li, Jia, et al.
Published: (2024)
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
by: Qian, Yusu, et al.
Published: (2025)
by: Qian, Yusu, et al.
Published: (2025)
XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression
by: Su, Zunhai, et al.
Published: (2026)
by: Su, Zunhai, et al.
Published: (2026)
XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression
by: Su, Zunhai, et al.
Published: (2026)
by: Su, Zunhai, et al.
Published: (2026)
CAD-Editor: A Locate-then-Infill Framework with Automated Training Data Synthesis for Text-Based CAD Editing
by: Yuan, Yu, et al.
Published: (2025)
by: Yuan, Yu, et al.
Published: (2025)
Steering Prepositional Phrases in Language Models: A Case of with-headed Adjectival and Adverbial Complements in Gemma-2
by: Arnold, Stefan, et al.
Published: (2025)
by: Arnold, Stefan, et al.
Published: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
by: Feng, Kunyu, et al.
Published: (2024)
by: Feng, Kunyu, et al.
Published: (2024)
ASTRA: Let Arbitrary Subjects Transform in Video Editing
by: Shen, Fei, et al.
Published: (2025)
by: Shen, Fei, et al.
Published: (2025)
RAViT: Resolution-Adaptive Vision Transformer
by: Guidez, Martial, et al.
Published: (2026)
by: Guidez, Martial, et al.
Published: (2026)
RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models
by: Ranjan, Ravi, et al.
Published: (2026)
by: Ranjan, Ravi, et al.
Published: (2026)
GGPT: Geometry Grounded Point Transformer
by: Chen, Yutong, et al.
Published: (2026)
by: Chen, Yutong, et al.
Published: (2026)
VGGT: Visual Geometry Grounded Transformer
by: Wang, Jianyuan, et al.
Published: (2025)
by: Wang, Jianyuan, et al.
Published: (2025)
Quantized Visual Geometry Grounded Transformer
by: Feng, Weilun, et al.
Published: (2025)
by: Feng, Weilun, et al.
Published: (2025)
Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation
by: He, Jingxuan, et al.
Published: (2026)
by: He, Jingxuan, et al.
Published: (2026)
LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight
by: Man, Yunze, et al.
Published: (2025)
by: Man, Yunze, et al.
Published: (2025)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
by: Li, Yan, et al.
Published: (2026)
by: Li, Yan, et al.
Published: (2026)
DeContext as Defense: Safe Image Editing in Diffusion Transformers
by: Shen, Linghui, et al.
Published: (2025)
by: Shen, Linghui, et al.
Published: (2025)
FluxSpace: Disentangled Semantic Editing in Rectified Flow Transformers
by: Dalva, Yusuf, et al.
Published: (2024)
by: Dalva, Yusuf, et al.
Published: (2024)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
by: Huang, Haifeng, et al.
Published: (2025)
by: Huang, Haifeng, et al.
Published: (2025)
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
by: Chen, Jiacheng, et al.
Published: (2025)
by: Chen, Jiacheng, et al.
Published: (2025)
LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation
by: Yuan, Yuqian, et al.
Published: (2026)
by: Yuan, Yuqian, et al.
Published: (2026)
InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning
by: Wan, Yecong, et al.
Published: (2026)
by: Wan, Yecong, et al.
Published: (2026)
PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing
by: Xu, Ruihang, et al.
Published: (2026)
by: Xu, Ruihang, et al.
Published: (2026)
Edit Transfer: Learning Image Editing via Vision In-Context Relations
by: Chen, Lan, et al.
Published: (2025)
by: Chen, Lan, et al.
Published: (2025)
Denoising Vision Transformers
by: Yang, Jiawei, et al.
Published: (2024)
by: Yang, Jiawei, et al.
Published: (2024)
Retina Vision Transformer (RetinaViT): Introducing Scaled Patches into Vision Transformers
by: Shu, Yuyang, et al.
Published: (2024)
by: Shu, Yuyang, et al.
Published: (2024)
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
by: Nützel, Felix, et al.
Published: (2025)
by: Nützel, Felix, et al.
Published: (2025)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
by: Zhou, Yue, et al.
Published: (2024)
by: Zhou, Yue, et al.
Published: (2024)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
by: Man, Yunze, et al.
Published: (2025)
by: Man, Yunze, et al.
Published: (2025)
Semantically Grounded QFormer for Efficient Vision Language Understanding
by: Choraria, Moulik, et al.
Published: (2023)
by: Choraria, Moulik, et al.
Published: (2023)
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
by: Wang, Shihao, et al.
Published: (2026)
by: Wang, Shihao, et al.
Published: (2026)
Multi-Modal Vision Transformers for Crop Mapping from Satellite Image Time Series
by: Follath, Theresa, et al.
Published: (2024)
by: Follath, Theresa, et al.
Published: (2024)
Feedforward 3D Editing Learns from Semantic-Part Transformation
by: Weng, Jiawei, et al.
Published: (2026)
by: Weng, Jiawei, et al.
Published: (2026)
MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale
by: Tang, Zhicong, et al.
Published: (2026)
by: Tang, Zhicong, et al.
Published: (2026)
Similar Items
-
Integrating Vision and Location with Transformers: A Multimodal Deep Learning Framework for Medical Wound Analysis
by: Mousa, Ramin, et al.
Published: (2025) -
LocateEdit-Bench: A Benchmark for Instruction-Based Editing Localization
by: Wu, Shiyu, et al.
Published: (2026) -
X-Edit: Exact, Explicit, and Explainable Null-Space Editing for Medical Vision Transformers
by: Liu, Yuanye, et al.
Published: (2026) -
Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors
by: Guo, Lanqing, et al.
Published: (2025) -
EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM
by: Nguyen, Quang, et al.
Published: (2024)