Localize, Understand, Collaborate: Semantic-Aware Dragging via Intention Reasoner
Fuente:
arXiv
Guardado en:
| Autores principales: | Cui, Xing, Li, Peipei, Li, Zekun, Liu, Xuannan, Zou, Yueying, He, Zhaofeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Survey on AI-Generated Media Detection: From Non-MLLM to MLLM
por: Zou, Yueying, et al.
Publicado: (2025)
por: Zou, Yueying, et al.
Publicado: (2025)
3-Tracer: A Tri-level Temporal-Aware Framework for Audio Forgery Detection and Localization
por: Xia, Shuhan, et al.
Publicado: (2025)
por: Xia, Shuhan, et al.
Publicado: (2025)
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
por: Liu, Xuannan, et al.
Publicado: (2024)
por: Liu, Xuannan, et al.
Publicado: (2024)
InstaStyle: Inversion Noise of a Stylized Image is Secretly a Style Adviser
por: Cui, Xing, et al.
Publicado: (2023)
por: Cui, Xing, et al.
Publicado: (2023)
MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs
por: Liu, Xuannan, et al.
Publicado: (2024)
por: Liu, Xuannan, et al.
Publicado: (2024)
ID-Cloak: Crafting Identity-Specific Cloaks Against Personalized Text-to-Image Generation
por: Teng, Qianrui, et al.
Publicado: (2025)
por: Teng, Qianrui, et al.
Publicado: (2025)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
por: Liu, Xuannan, et al.
Publicado: (2025)
por: Liu, Xuannan, et al.
Publicado: (2025)
AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs
por: Xia, Shuhan, et al.
Publicado: (2025)
por: Xia, Shuhan, et al.
Publicado: (2025)
GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?
por: Zou, Yueying, et al.
Publicado: (2026)
por: Zou, Yueying, et al.
Publicado: (2026)
Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
por: Wang, Yijia, et al.
Publicado: (2025)
por: Wang, Yijia, et al.
Publicado: (2025)
SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis
por: Zhang, Chenghanyu, et al.
Publicado: (2025)
por: Zhang, Chenghanyu, et al.
Publicado: (2025)
SphereDrag: Spherical Geometry-Aware Panoramic Image Editing
por: Feng, Zhiao, et al.
Publicado: (2025)
por: Feng, Zhiao, et al.
Publicado: (2025)
AdaptiveDrag: Semantic-Driven Dragging on Diffusion-Based Image Editing
por: Chen, DuoSheng, et al.
Publicado: (2024)
por: Chen, DuoSheng, et al.
Publicado: (2024)
StableDrag: Stable Dragging for Point-based Image Editing
por: Cui, Yutao, et al.
Publicado: (2024)
por: Cui, Yutao, et al.
Publicado: (2024)
Reasoning in Space via Grounding in the World
por: Chen, Yiming, et al.
Publicado: (2025)
por: Chen, Yiming, et al.
Publicado: (2025)
Enhancing Generalization of Invisible Facial Privacy Cloak via Gradient Accumulation
por: Liu, Xuannan, et al.
Publicado: (2024)
por: Liu, Xuannan, et al.
Publicado: (2024)
DynaDrag: Dynamic Drag-Style Image Editing by Motion Prediction
por: Sui, Jiacheng, et al.
Publicado: (2026)
por: Sui, Jiacheng, et al.
Publicado: (2026)
MoGIC: Boosting Motion Generation via Intention Understanding and Visual Context
por: Shi, Junyu, et al.
Publicado: (2025)
por: Shi, Junyu, et al.
Publicado: (2025)
Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark
por: Hu, Jinpeng, et al.
Publicado: (2025)
por: Hu, Jinpeng, et al.
Publicado: (2025)
FedSC: Federated Learning with Semantic-Aware Collaboration
por: Wang, Huan, et al.
Publicado: (2025)
por: Wang, Huan, et al.
Publicado: (2025)
Generative Iris Prior Embedded Transformer for Iris Restoration
por: Huang, Yubo, et al.
Publicado: (2024)
por: Huang, Yubo, et al.
Publicado: (2024)
Intention-Aware Diffusion Model for Pedestrian Trajectory Prediction
por: Liu, Yu, et al.
Publicado: (2025)
por: Liu, Yu, et al.
Publicado: (2025)
Efficient Face Super-Resolution via Wavelet-based Feature Enhancement Network
por: Li, Wenjie, et al.
Publicado: (2024)
por: Li, Wenjie, et al.
Publicado: (2024)
ContextDrag: Precise Drag-Based Image Editing via Context-Preserving Token Injection and Position-Aligned Attention
por: He, Huiguo, et al.
Publicado: (2025)
por: He, Huiguo, et al.
Publicado: (2025)
DragLoRA: Online Optimization of LoRA Adapters for Drag-based Image Editing in Diffusion Model
por: Xia, Siwei, et al.
Publicado: (2025)
por: Xia, Siwei, et al.
Publicado: (2025)
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
por: Li, Yueying, et al.
Publicado: (2026)
por: Li, Yueying, et al.
Publicado: (2026)
T^2Agent A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree Search
por: Cui, Xing, et al.
Publicado: (2025)
por: Cui, Xing, et al.
Publicado: (2025)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
por: Li, Huilai, et al.
Publicado: (2025)
por: Li, Huilai, et al.
Publicado: (2025)
SPAN: Continuous Modeling of Suspicion Progression for Temporal Intention Localization
por: Hu, Xinyi, et al.
Publicado: (2025)
por: Hu, Xinyi, et al.
Publicado: (2025)
Semantic-Aware Representation Learning via Conditional Transport for Multi-Label Image Classification
por: Xie, Ren-Dong, et al.
Publicado: (2025)
por: Xie, Ren-Dong, et al.
Publicado: (2025)
Drag Your Noise: Interactive Point-based Editing via Diffusion Semantic Propagation
por: Liu, Haofeng, et al.
Publicado: (2024)
por: Liu, Haofeng, et al.
Publicado: (2024)
SemanticSplat: Feed-Forward 3D Scene Understanding with Language-Aware Gaussian Fields
por: Li, Qijing, et al.
Publicado: (2025)
por: Li, Qijing, et al.
Publicado: (2025)
DragAnything: Motion Control for Anything using Entity Representation
por: Wu, Weijia, et al.
Publicado: (2024)
por: Wu, Weijia, et al.
Publicado: (2024)
Cognition Transferring and Decoupling for Text-supervised Egocentric Semantic Segmentation
por: Shi, Zhaofeng, et al.
Publicado: (2024)
por: Shi, Zhaofeng, et al.
Publicado: (2024)
Occlusion-Aware Diffusion Model for Pedestrian Intention Prediction
por: Liu, Yu, et al.
Publicado: (2025)
por: Liu, Yu, et al.
Publicado: (2025)
InstantDrag: Improving Interactivity in Drag-based Image Editing
por: Shin, Joonghyuk, et al.
Publicado: (2024)
por: Shin, Joonghyuk, et al.
Publicado: (2024)
RealDrag: The First Dragging Benchmark with Real Target Image
por: Zafarani, Ahmad, et al.
Publicado: (2025)
por: Zafarani, Ahmad, et al.
Publicado: (2025)
DragNeXt: Rethinking Drag-Based Image Editing
por: Zhou, Yuan, et al.
Publicado: (2025)
por: Zhou, Yuan, et al.
Publicado: (2025)
Drag Your Gaussian: Effective Drag-Based Editing with Score Distillation for 3D Gaussian Splatting
por: Qu, Yansong, et al.
Publicado: (2025)
por: Qu, Yansong, et al.
Publicado: (2025)
LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
por: Yin, Zixin, et al.
Publicado: (2025)
por: Yin, Zixin, et al.
Publicado: (2025)
Ejemplares similares
-
Survey on AI-Generated Media Detection: From Non-MLLM to MLLM
por: Zou, Yueying, et al.
Publicado: (2025) -
3-Tracer: A Tri-level Temporal-Aware Framework for Audio Forgery Detection and Localization
por: Xia, Shuhan, et al.
Publicado: (2025) -
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
por: Liu, Xuannan, et al.
Publicado: (2024) -
InstaStyle: Inversion Noise of a Stylized Image is Secretly a Style Adviser
por: Cui, Xing, et al.
Publicado: (2023) -
MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs
por: Liu, Xuannan, et al.
Publicado: (2024)