GaGA: Towards Interactive Global Geolocation Assistant
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dou, Zhiyang, Wang, Zipeng, Han, Xumeng, Li, Guorong, Huang, Zhipei, Han, Zhenjun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views
par: Li, Jiashu, et autres
Publié: (2026)
par: Li, Jiashu, et autres
Publié: (2026)
ViMoE: An Empirical Study of Designing Vision Mixture-of-Experts
par: Han, Xumeng, et autres
Publié: (2024)
par: Han, Xumeng, et autres
Publié: (2024)
Boosting Segment Anything Model Towards Open-Vocabulary Learning
par: Han, Xumeng, et autres
Publié: (2023)
par: Han, Xumeng, et autres
Publié: (2023)
P2Seg: Pointly-supervised Segmentation via Mutual Distillation
par: Wang, Zipeng, et autres
Publié: (2024)
par: Wang, Zipeng, et autres
Publié: (2024)
SAPNet++: Evolving Point-Prompted Instance Segmentation with Semantic and Spatial Awareness
par: Wei, Zhaoyang, et autres
Publié: (2026)
par: Wei, Zhaoyang, et autres
Publié: (2026)
CPR++: Object Localization via Single Coarse Point Supervision
par: Yu, Xuehui, et autres
Publié: (2024)
par: Yu, Xuehui, et autres
Publié: (2024)
P2Object: Single Point Supervised Object Detection and Instance Segmentation
par: Chen, Pengfei, et autres
Publié: (2025)
par: Chen, Pengfei, et autres
Publié: (2025)
VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
par: Qiang, Chenhui, et autres
Publié: (2025)
par: Qiang, Chenhui, et autres
Publié: (2025)
P2RBox: Point Prompt Oriented Object Detection with SAM
par: Cao, Guangming, et autres
Publié: (2023)
par: Cao, Guangming, et autres
Publié: (2023)
Rethinking Sampling Strategies for Unsupervised Person Re-identification
par: Han, Xumeng, et autres
Publié: (2021)
par: Han, Xumeng, et autres
Publié: (2021)
ClickTrack: Towards Real-time Interactive Single Object Tracking
par: Wang, Kuiran, et autres
Publié: (2024)
par: Wang, Kuiran, et autres
Publié: (2024)
AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions
par: Wei, Zhaoyang, et autres
Publié: (2025)
par: Wei, Zhaoyang, et autres
Publié: (2025)
Semantic-aware SAM for Point-Prompted Instance Segmentation
par: Wei, Zhaoyang, et autres
Publié: (2023)
par: Wei, Zhaoyang, et autres
Publié: (2023)
Dynamic Realms: 4D Content Analysis, Recovery and Generation with Geometric, Topological and Physical Priors
par: Dou, Zhiyang
Publié: (2024)
par: Dou, Zhiyang
Publié: (2024)
AdaGaR: Adaptive Gabor Representation for Dynamic Scene Reconstruction
par: Chan, Jiewen, et autres
Publié: (2026)
par: Chan, Jiewen, et autres
Publié: (2026)
GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization
par: Wang, Yikun, et autres
Publié: (2025)
par: Wang, Yikun, et autres
Publié: (2025)
Text2Interact: High-Fidelity and Diverse Text-to-Two-Person Interaction Generation
par: Wu, Qingxuan, et autres
Publié: (2025)
par: Wu, Qingxuan, et autres
Publié: (2025)
TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task Tokenization
par: Pan, Liang, et autres
Publié: (2025)
par: Pan, Liang, et autres
Publié: (2025)
Depth Matters: Exploring Deep Interactions of RGB-D for Semantic Segmentation in Traffic Scenes
par: Chen, Siyu, et autres
Publié: (2024)
par: Chen, Siyu, et autres
Publié: (2024)
ModSkill: Physical Character Skill Modularization
par: Huang, Yiming, et autres
Publié: (2025)
par: Huang, Yiming, et autres
Publié: (2025)
Soft Anisotropic Diagrams for Differentiable Image Representation
par: Iinbor, Laki, et autres
Publié: (2026)
par: Iinbor, Laki, et autres
Publié: (2026)
CurriculumLoc: Enhancing Cross-Domain Geolocalization through Multi-Stage Refinement
par: Hu, Boni, et autres
Publié: (2023)
par: Hu, Boni, et autres
Publié: (2023)
Change-Agent: Towards Interactive Comprehensive Remote Sensing Change Interpretation and Analysis
par: Liu, Chenyang, et autres
Publié: (2024)
par: Liu, Chenyang, et autres
Publié: (2024)
Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning
par: Zheng, Yushuo, et autres
Publié: (2026)
par: Zheng, Yushuo, et autres
Publié: (2026)
MVTokenFlow: High-quality 4D Content Generation using Multiview Token Flow
par: Huang, Hanzhuo, et autres
Publié: (2025)
par: Huang, Hanzhuo, et autres
Publié: (2025)
Statewide Visual Geolocalization in the Wild
par: Fervers, Florian, et autres
Publié: (2024)
par: Fervers, Florian, et autres
Publié: (2024)
GlobalPointer: Large-Scale Plane Adjustment with Bi-Convex Relaxation
par: Liao, Bangyan, et autres
Publié: (2024)
par: Liao, Bangyan, et autres
Publié: (2024)
EgoLife: Towards Egocentric Life Assistant
par: Yang, Jingkang, et autres
Publié: (2025)
par: Yang, Jingkang, et autres
Publié: (2025)
Towards Harmless Multimodal Assistants with Blind Preference Optimization
par: Li, Yongqi, et autres
Publié: (2025)
par: Li, Yongqi, et autres
Publié: (2025)
MeGA: Hybrid Mesh-Gaussian Head Avatar for High-Fidelity Rendering and Head Editing
par: Wang, Cong, et autres
Publié: (2024)
par: Wang, Cong, et autres
Publié: (2024)
Pay Attention and Move Better: Harnessing Attention for Interactive Motion Generation and Training-free Editing
par: Chen, Ling-Hao, et autres
Publié: (2024)
par: Chen, Ling-Hao, et autres
Publié: (2024)
SketchAssist: A Practical Assistant for Semantic Edits and Precise Local Redrawing
par: Zou, Han, et autres
Publié: (2025)
par: Zou, Han, et autres
Publié: (2025)
PyGS: Large-scale Scene Representation with Pyramidal 3D Gaussian Splatting
par: Wang, Zipeng, et autres
Publié: (2024)
par: Wang, Zipeng, et autres
Publié: (2024)
HyRF: Hybrid Radiance Fields for Memory-efficient and High-quality Novel View Synthesis
par: Wang, Zipeng, et autres
Publié: (2025)
par: Wang, Zipeng, et autres
Publié: (2025)
FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention
par: Wang, Zipeng, et autres
Publié: (2025)
par: Wang, Zipeng, et autres
Publié: (2025)
Interpretable Perception and Reasoning for Audiovisual Geolocation
par: Su, Yiyang, et autres
Publié: (2026)
par: Su, Yiyang, et autres
Publié: (2026)
GAEA: A Geolocation Aware Conversational Assistant
par: Campos, Ron, et autres
Publié: (2025)
par: Campos, Ron, et autres
Publié: (2025)
Resolving Ambiguity in Gaze-Facilitated Visual Assistant Interaction Paradigm
par: Wang, Zeyu, et autres
Publié: (2025)
par: Wang, Zeyu, et autres
Publié: (2025)
Mixpert: Mitigating Multimodal Learning Conflicts with Efficient Mixture-of-Vision-Experts
par: He, Xin, et autres
Publié: (2025)
par: He, Xin, et autres
Publié: (2025)
Towards Generative Location Awareness for Disaster Response: A Probabilistic Cross-view Geolocalization Approach
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Documents similaires
-
HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views
par: Li, Jiashu, et autres
Publié: (2026) -
ViMoE: An Empirical Study of Designing Vision Mixture-of-Experts
par: Han, Xumeng, et autres
Publié: (2024) -
Boosting Segment Anything Model Towards Open-Vocabulary Learning
par: Han, Xumeng, et autres
Publié: (2023) -
P2Seg: Pointly-supervised Segmentation via Mutual Distillation
par: Wang, Zipeng, et autres
Publié: (2024) -
SAPNet++: Evolving Point-Prompted Instance Segmentation with Semantic and Spatial Awareness
par: Wei, Zhaoyang, et autres
Publié: (2026)