Warehouse Spatial Question Answering with LLM Agent
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Hsiang-Wei, Cheng, Jen-Hao, Chen, Kuang-Ming, Yang, Cheng-Yen, Alattar, Bahaa, Lin, Yi-Ru, Kim, Pyongkun, Kim, Sangwon, Kim, Kwangju, Huang, Chung-I, Hwang, Jenq-Neng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Detector-in-the-Loop Tracking: Active Memory Rectification for Stable Glottic Opening Localization
by: Wang, Huayu, et al.
Published: (2026)
by: Wang, Huayu, et al.
Published: (2026)
ToSA: Token Merging with Spatial Awareness
by: Huang, Hsiang-Wei, et al.
Published: (2025)
by: Huang, Hsiang-Wei, et al.
Published: (2025)
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
by: Huang, Hsiang-Wei, et al.
Published: (2026)
by: Huang, Hsiang-Wei, et al.
Published: (2026)
Reasoning Matters for 3D Visual Grounding
by: Huang, Hsiang-Wei, et al.
Published: (2026)
by: Huang, Hsiang-Wei, et al.
Published: (2026)
From Global to Local: Rethinking CLIP Feature Aggregation for Person Re-Identification
by: Zheng, Aotian, et al.
Published: (2026)
by: Zheng, Aotian, et al.
Published: (2026)
Technical Report for ReID-SAM on SkiTB Visual Tracking Challenge 2025
by: Li, Kunjun, et al.
Published: (2025)
by: Li, Kunjun, et al.
Published: (2025)
CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models
by: Huang, Hsiang-Wei, et al.
Published: (2026)
by: Huang, Hsiang-Wei, et al.
Published: (2026)
SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory
by: Yang, Cheng-Yen, et al.
Published: (2024)
by: Yang, Cheng-Yen, et al.
Published: (2024)
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
by: Huang, Hsiang-Wei, et al.
Published: (2024)
by: Huang, Hsiang-Wei, et al.
Published: (2024)
GTA: Global Tracklet Association for Multi-Object Tracking in Sports
by: Sun, Jiacheng, et al.
Published: (2024)
by: Sun, Jiacheng, et al.
Published: (2024)
A Density-Guided Temporal Attention Transformer for Indiscernible Object Counting in Underwater Video
by: Yang, Cheng-Yen, et al.
Published: (2024)
by: Yang, Cheng-Yen, et al.
Published: (2024)
Adapting SAM 2 for Visual Object Tracking: 1st Place Solution for MMVPR Challenge Multi-Modal Tracking
by: Yang, Cheng-Yen, et al.
Published: (2025)
by: Yang, Cheng-Yen, et al.
Published: (2025)
PackDiT: Joint Human Motion and Text Generation via Mutual Prompting
by: Jiang, Zhongyu, et al.
Published: (2025)
by: Jiang, Zhongyu, et al.
Published: (2025)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
by: Song, Enxin, et al.
Published: (2024)
by: Song, Enxin, et al.
Published: (2024)
Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression
by: Li, Kunjun, et al.
Published: (2025)
by: Li, Kunjun, et al.
Published: (2025)
Boosting Online 3D Multi-Object Tracking through Camera-Radar Cross Check
by: Kuan, Sheng-Yao, et al.
Published: (2024)
by: Kuan, Sheng-Yao, et al.
Published: (2024)
Single-image driven 3d viewpoint training data augmentation for effective wine label recognition
by: Huang, Yueh-Cheng, et al.
Published: (2024)
by: Huang, Yueh-Cheng, et al.
Published: (2024)
ToddlerAct: A Toddler Action Recognition Dataset for Gross Motor Development Assessment
by: Huang, Hsiang-Wei, et al.
Published: (2024)
by: Huang, Hsiang-Wei, et al.
Published: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
by: Lee, Dosung, et al.
Published: (2025)
by: Lee, Dosung, et al.
Published: (2025)
RT-Pose: A 4D Radar Tensor-based 3D Human Pose Estimation and Localization Benchmark
by: Ho, Yuan-Hao, et al.
Published: (2024)
by: Ho, Yuan-Hao, et al.
Published: (2024)
Understanding Identity Continuity in Thermal Video through Scene-Level Consistency
by: Sun, Wei-Chieh, et al.
Published: (2026)
by: Sun, Wei-Chieh, et al.
Published: (2026)
TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action
by: Cheng, Jen-Hao, et al.
Published: (2025)
by: Cheng, Jen-Hao, et al.
Published: (2025)
UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
by: Jiang, Zhongyu, et al.
Published: (2025)
by: Jiang, Zhongyu, et al.
Published: (2025)
Exploring Probabilistic Modeling Beyond Domain Generalization for Semantic Segmentation
by: Chen, I-Hsiang, et al.
Published: (2025)
by: Chen, I-Hsiang, et al.
Published: (2025)
KoBLEX: Open Legal Question Answering with Multi-hop Reasoning
by: Lee, Jihyung, et al.
Published: (2025)
by: Lee, Jihyung, et al.
Published: (2025)
Effects of Autoimmune Thyroiditis on Pregnancy Outcomes: Analysis of the Nationwide Inpatient Sample, 2016–2020
by: Chung‐Jen Teng, et al.
Published: (2026)
by: Chung‐Jen Teng, et al.
Published: (2026)
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
by: Wang, Gaoang, et al.
Published: (2022)
by: Wang, Gaoang, et al.
Published: (2022)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
by: Kim, Kangsan, et al.
Published: (2026)
by: Kim, Kangsan, et al.
Published: (2026)
FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering
by: Choi, Chanyeol, et al.
Published: (2025)
by: Choi, Chanyeol, et al.
Published: (2025)
Metacognitive Behavioral Tuning of Large Language Models for Multi-Hop Question Answering
by: Kim, Ik-hwan, et al.
Published: (2026)
by: Kim, Ik-hwan, et al.
Published: (2026)
TVMC: Time-Varying Mesh Compression via Multi-Stage Anchor Mesh Generation
by: Huang, He, et al.
Published: (2025)
by: Huang, He, et al.
Published: (2025)
Evaluating Consistencies in LLM responses through a Semantic Clustering of Question Answering
by: Lee, Yanggyu, et al.
Published: (2024)
by: Lee, Yanggyu, et al.
Published: (2024)
None of the Above, Less of the Right: Parallel Patterns between Humans and LLMs on Multi-Choice Questions Answering
by: Tam, Zhi Rui, et al.
Published: (2025)
by: Tam, Zhi Rui, et al.
Published: (2025)
DAug: Diffusion-based Channel Augmentation for Radiology Image Retrieval and Classification
by: Jin, Ying, et al.
Published: (2024)
by: Jin, Ying, et al.
Published: (2024)
Cooperative Multi-Agent Deep Reinforcement Learning Methods for UAV-aided Mobile Edge Computing Networks
by: Kim, Mintae, et al.
Published: (2024)
by: Kim, Mintae, et al.
Published: (2024)
Learning 3D Object Spatial Relationships from Pre-trained 2D Diffusion Models
by: Baik, Sangwon, et al.
Published: (2025)
by: Baik, Sangwon, et al.
Published: (2025)
Context Filtering with Reward Modeling in Question Answering
by: Kim, Sangryul, et al.
Published: (2024)
by: Kim, Sangryul, et al.
Published: (2024)
Ruling Out to Rule In: Contrastive Hypothesis Retrieval for Medical Question Answering
by: Kim, Byeolhee, et al.
Published: (2026)
by: Kim, Byeolhee, et al.
Published: (2026)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
by: Lim, Su Hyeon, et al.
Published: (2024)
by: Lim, Su Hyeon, et al.
Published: (2024)
Efficient Multi-Hop Question Answering over Knowledge Graphs via LLM Planning and Embedding-Guided Search
by: Shrestha, Manil, et al.
Published: (2025)
by: Shrestha, Manil, et al.
Published: (2025)
Similar Items
-
Detector-in-the-Loop Tracking: Active Memory Rectification for Stable Glottic Opening Localization
by: Wang, Huayu, et al.
Published: (2026) -
ToSA: Token Merging with Spatial Awareness
by: Huang, Hsiang-Wei, et al.
Published: (2025) -
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
by: Huang, Hsiang-Wei, et al.
Published: (2026) -
Reasoning Matters for 3D Visual Grounding
by: Huang, Hsiang-Wei, et al.
Published: (2026) -
From Global to Local: Rethinking CLIP Feature Aggregation for Person Re-Identification
by: Zheng, Aotian, et al.
Published: (2026)