Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
Fuente:
arXiv
Salvato in:
| Autori principali: | Chu, Meng, Zheng, Zhedong, Ji, Wei, Wang, Tingyu, Chua, Tat-Seng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
di: Lan, Xing, et al.
Pubblicazione: (2024)
di: Lan, Xing, et al.
Pubblicazione: (2024)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
Scene-Text Grounding for Text-Based Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis
di: Fang, Jianwu, et al.
Pubblicazione: (2025)
di: Fang, Jianwu, et al.
Pubblicazione: (2025)
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
SEED: A Benchmark Dataset for Sequential Facial Attribute Editing with Diffusion Models
di: Zhu, Yule, et al.
Pubblicazione: (2025)
di: Zhu, Yule, et al.
Pubblicazione: (2025)
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
di: Yu, Hang, et al.
Pubblicazione: (2025)
di: Yu, Hang, et al.
Pubblicazione: (2025)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
di: Liu, Han, et al.
Pubblicazione: (2025)
di: Liu, Han, et al.
Pubblicazione: (2025)
Smart Fitting Room: A One-stop Framework for Matching-aware Virtual Try-on
di: Yu, Mingzhe, et al.
Pubblicazione: (2024)
di: Yu, Mingzhe, et al.
Pubblicazione: (2024)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
di: Li, Yongqi, et al.
Pubblicazione: (2024)
di: Li, Yongqi, et al.
Pubblicazione: (2024)
Discriminative Probing and Tuning for Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
di: Sun, Jintao, et al.
Pubblicazione: (2024)
di: Sun, Jintao, et al.
Pubblicazione: (2024)
Principled Multimodal Representation Learning
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
Calibrated Multimodal Representation Learning with Missing Modalities
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Every Painting Awakened: A Training-free Framework for Painting-to-Animation Generation
di: Liu, Lingyu, et al.
Pubblicazione: (2025)
di: Liu, Lingyu, et al.
Pubblicazione: (2025)
Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
di: Liu, Lingyu, et al.
Pubblicazione: (2026)
di: Liu, Lingyu, et al.
Pubblicazione: (2026)
Simple but Effective Raw-Data Level Multimodal Fusion for Composed Image Retrieval
di: Wen, Haokun, et al.
Pubblicazione: (2024)
di: Wen, Haokun, et al.
Pubblicazione: (2024)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
di: Li, Yongqi, et al.
Pubblicazione: (2024)
di: Li, Yongqi, et al.
Pubblicazione: (2024)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
ProtT3: Protein-to-Text Generation for Text-based Protein Understanding
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
di: Qu, Leigang, et al.
Pubblicazione: (2025)
di: Qu, Leigang, et al.
Pubblicazione: (2025)
Look, Compare and Draw: Differential Query Transformer for Automatic Oil Painting
di: Liu, Lingyu, et al.
Pubblicazione: (2026)
di: Liu, Lingyu, et al.
Pubblicazione: (2026)
Multiple-environment Self-adaptive Network for Aerial-view Geo-localization
di: Wang, Tingyu, et al.
Pubblicazione: (2022)
di: Wang, Tingyu, et al.
Pubblicazione: (2022)
CIRP: Cross-Item Relational Pre-training for Multimodal Product Bundling
di: Ma, Yunshan, et al.
Pubblicazione: (2024)
di: Ma, Yunshan, et al.
Pubblicazione: (2024)
Road Maps as Free Geometric Priors: Weather-Invariant Drone Geo-Localization with GeoFuse
di: Fang, Yunsong, et al.
Pubblicazione: (2026)
di: Fang, Yunsong, et al.
Pubblicazione: (2026)
Gorgeous: Create Your Desired Character Facial Makeup from Any Ideas
di: Sii, Jia Wei, et al.
Pubblicazione: (2024)
di: Sii, Jia Wei, et al.
Pubblicazione: (2024)
Protégé: Learn and Generate Basic Makeup Styles with Generative Adversarial Networks (GANs)
di: Sii, Jia Wei, et al.
Pubblicazione: (2024)
di: Sii, Jia Wei, et al.
Pubblicazione: (2024)
Ambiguity-Aware and High-Order Relation Learning for Multi-Grained Image-Text Matching
di: Chen, Junyu, et al.
Pubblicazione: (2025)
di: Chen, Junyu, et al.
Pubblicazione: (2025)
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
di: Shi, Chuancheng, et al.
Pubblicazione: (2026)
di: Shi, Chuancheng, et al.
Pubblicazione: (2026)
Seeing Text in the Dark: Algorithm and Benchmark
di: Xu, Chengpei, et al.
Pubblicazione: (2024)
di: Xu, Chengpei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026) -
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025) -
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
di: Lan, Xing, et al.
Pubblicazione: (2024) -
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023) -
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
di: Yang, Shuyu, et al.
Pubblicazione: (2024)