Forest-Chat: Adapting Vision-Language Agents for Interactive Forest Change Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Brock, James, Zhang, Ce, Anantrasirichai, Nantheera |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision-Language Agents for Interactive Forest Change Analysis
par: Brock, James, et autres
Publié: (2026)
par: Brock, James, et autres
Publié: (2026)
GUICourse: From General Vision Language Models to Versatile GUI Agents
par: Chen, Wentong, et autres
Publié: (2024)
par: Chen, Wentong, et autres
Publié: (2024)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
par: Qin, Yujia, et autres
Publié: (2025)
par: Qin, Yujia, et autres
Publié: (2025)
ScreenAgent: A Vision Language Model-driven Computer Control Agent
par: Niu, Runliang, et autres
Publié: (2024)
par: Niu, Runliang, et autres
Publié: (2024)
A Survey on (M)LLM-Based GUI Agents
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
MAPWise: Evaluating Vision-Language Models for Advanced Map Queries
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks
par: Wu, Zongru, et autres
Publié: (2025)
par: Wu, Zongru, et autres
Publié: (2025)
A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models
par: Tsangko, Iosif, et autres
Publié: (2026)
par: Tsangko, Iosif, et autres
Publié: (2026)
Tur[k]ingBench: A Challenge Benchmark for Web Agents
par: Xu, Kevin, et autres
Publié: (2024)
par: Xu, Kevin, et autres
Publié: (2024)
History-Aware Reasoning for GUI Agents
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
par: Cheng, Kanzhi, et autres
Publié: (2026)
par: Cheng, Kanzhi, et autres
Publié: (2026)
OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?
par: Chen, Xuetian, et autres
Publié: (2025)
par: Chen, Xuetian, et autres
Publié: (2025)
OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
par: Sun, Qiushi, et autres
Publié: (2025)
par: Sun, Qiushi, et autres
Publié: (2025)
ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows
par: Sun, Qiushi, et autres
Publié: (2025)
par: Sun, Qiushi, et autres
Publié: (2025)
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
Vision-Language Models Suppress Female Representations Under Ambiguous Input
par: Marin-Llobet, Arnau, et autres
Publié: (2026)
par: Marin-Llobet, Arnau, et autres
Publié: (2026)
InterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models via Human Feedback
par: Zhao, Henry Hengyuan, et autres
Publié: (2025)
par: Zhao, Henry Hengyuan, et autres
Publié: (2025)
AppCopilot: Toward General, Accurate, Long-Horizon, and Efficient Mobile Agent
par: Fan, Jingru, et autres
Publié: (2025)
par: Fan, Jingru, et autres
Publié: (2025)
DOTA: Distributional Test-Time Adaptation of Vision-Language Models
par: Han, Zongbo, et autres
Publié: (2024)
par: Han, Zongbo, et autres
Publié: (2024)
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
par: Sun, Qiushi, et autres
Publié: (2024)
par: Sun, Qiushi, et autres
Publié: (2024)
OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web
par: Kapoor, Raghav, et autres
Publié: (2024)
par: Kapoor, Raghav, et autres
Publié: (2024)
Can Large Language Models Capture Video Game Engagement?
par: Melhart, David, et autres
Publié: (2025)
par: Melhart, David, et autres
Publié: (2025)
SwissADT: An Audio Description Translation System for Swiss Languages
par: Fischer, Lukas, et autres
Publié: (2024)
par: Fischer, Lukas, et autres
Publié: (2024)
SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation
par: Khalil, Mohammad Amer, et autres
Publié: (2026)
par: Khalil, Mohammad Amer, et autres
Publié: (2026)
Seeing Eye to AI: Human Alignment via Gaze-Based Response Rewards for Large Language Models
par: Lopez-Cardona, Angela, et autres
Publié: (2024)
par: Lopez-Cardona, Angela, et autres
Publié: (2024)
BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
par: Lin, Shuhang, et autres
Publié: (2024)
par: Lin, Shuhang, et autres
Publié: (2024)
Not There Yet: Evaluating Vision Language Models in Simulating the Visual Perception of People with Low Vision
par: Natalie, Rosiana, et autres
Publié: (2025)
par: Natalie, Rosiana, et autres
Publié: (2025)
SkinGEN: an Explainable Dermatology Diagnosis-to-Generation Framework with Interactive Vision-Language Models
par: Lin, Bo, et autres
Publié: (2024)
par: Lin, Bo, et autres
Publié: (2024)
MAP: Evaluation and Multi-Agent Enhancement of Large Language Models for Inpatient Pathways
par: Chen, Zhen, et autres
Publié: (2025)
par: Chen, Zhen, et autres
Publié: (2025)
T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation
par: Chen, Chieh-Yun, et autres
Publié: (2025)
par: Chen, Chieh-Yun, et autres
Publié: (2025)
Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
Do Vision Language Models Understand Human Engagement in Games?
par: Wang, Ziyi, et autres
Publié: (2026)
par: Wang, Ziyi, et autres
Publié: (2026)
Achieving Effective Virtual Reality Interactions via Acoustic Gesture Recognition based on Large Language Models
par: Zhang, Xijie, et autres
Publié: (2025)
par: Zhang, Xijie, et autres
Publié: (2025)
See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm
par: Zhao, Haoyu, et autres
Publié: (2025)
par: Zhao, Haoyu, et autres
Publié: (2025)
UISim: An Interactive Image-Based UI Simulator for Dynamic Mobile Environments
par: Xiang, Jiannan, et autres
Publié: (2025)
par: Xiang, Jiannan, et autres
Publié: (2025)
Proactive Assistant Dialogue Generation from Streaming Egocentric Videos
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
VISLIX: An XAI Framework for Validating Vision Models with Slice Discovery and Analysis
par: Yan, Xinyuan, et autres
Publié: (2025)
par: Yan, Xinyuan, et autres
Publié: (2025)
ASL STEM Wiki: Dataset and Benchmark for Interpreting STEM Articles
par: Yin, Kayo, et autres
Publié: (2024)
par: Yin, Kayo, et autres
Publié: (2024)
AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
Documents similaires
-
Vision-Language Agents for Interactive Forest Change Analysis
par: Brock, James, et autres
Publié: (2026) -
GUICourse: From General Vision Language Models to Versatile GUI Agents
par: Chen, Wentong, et autres
Publié: (2024) -
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
par: Lin, Kevin Qinghong, et autres
Publié: (2024) -
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
par: Qin, Yujia, et autres
Publié: (2025) -
ScreenAgent: A Vision Language Model-driven Computer Control Agent
par: Niu, Runliang, et autres
Publié: (2024)