CLOVA: A Closed-Loop Visual Assistant with Tool Usage and Update
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Zhi, Du, Yuntao, Zhang, Xintong, Ma, Xiaojian, Han, Wenjuan, Zhu, Song-Chun, Li, Qing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
di: Gao, Zhi, et al.
Pubblicazione: (2024)
di: Gao, Zhi, et al.
Pubblicazione: (2024)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
di: Fan, Yue, et al.
Pubblicazione: (2024)
di: Fan, Yue, et al.
Pubblicazione: (2024)
Building LLM Agents by Incorporating Insights from Computer Systems
di: Mi, Yapeng, et al.
Pubblicazione: (2025)
di: Mi, Yapeng, et al.
Pubblicazione: (2025)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
di: Zhang, Xintong, et al.
Pubblicazione: (2025)
di: Zhang, Xintong, et al.
Pubblicazione: (2025)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
di: Zhang, Bofei, et al.
Pubblicazione: (2025)
di: Zhang, Bofei, et al.
Pubblicazione: (2025)
Resolving Ambiguity in Gaze-Facilitated Visual Assistant Interaction Paradigm
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
HyperCLOVA X 32B Think
di: NAVER Cloud HyperCLOVA X Team
Pubblicazione: (2026)
di: NAVER Cloud HyperCLOVA X Team
Pubblicazione: (2026)
Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning
di: Cheng, Hanbo, et al.
Pubblicazione: (2026)
di: Cheng, Hanbo, et al.
Pubblicazione: (2026)
The VEP Booster: A Closed-Loop AI System for Visual EEG Biomarker Auto-generation
di: Luo, Junwen, et al.
Pubblicazione: (2024)
di: Luo, Junwen, et al.
Pubblicazione: (2024)
From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes
di: Wang, Tianxu, et al.
Pubblicazione: (2025)
di: Wang, Tianxu, et al.
Pubblicazione: (2025)
LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning
di: Huang, Jiangyong, et al.
Pubblicazione: (2025)
di: Huang, Jiangyong, et al.
Pubblicazione: (2025)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
Driving with A Thousand Faces: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving
di: Dong, Xiaoru, et al.
Pubblicazione: (2026)
di: Dong, Xiaoru, et al.
Pubblicazione: (2026)
LoopViT: Scaling Visual ARC with Looped Transformers
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models
di: Liu, Jingming, et al.
Pubblicazione: (2024)
di: Liu, Jingming, et al.
Pubblicazione: (2024)
VSAS-Bench: Real-Time Evaluation of Visual Streaming Assistant Models
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2026)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2026)
Visual Intention Grounding for Egocentric Assistants
di: Sun, Pengzhan, et al.
Pubblicazione: (2025)
di: Sun, Pengzhan, et al.
Pubblicazione: (2025)
NEP: Autoregressive Image Editing via Next Editing Token Prediction
di: Wu, Huimin, et al.
Pubblicazione: (2025)
di: Wu, Huimin, et al.
Pubblicazione: (2025)
Semantic Gaussians: Open-Vocabulary Scene Understanding with 3D Gaussian Splatting
di: Guo, Jun, et al.
Pubblicazione: (2024)
di: Guo, Jun, et al.
Pubblicazione: (2024)
World-in-World: World Models in a Closed-Loop World
di: Zhang, Jiahan, et al.
Pubblicazione: (2025)
di: Zhang, Jiahan, et al.
Pubblicazione: (2025)
DK-SLAM: Monocular Visual SLAM with Deep Keypoint Learning, Tracking and Loop-Closing
di: Qu, Hao, et al.
Pubblicazione: (2024)
di: Qu, Hao, et al.
Pubblicazione: (2024)
HumanSplatHMR: Closing the Loop Between Human Mesh Recovery and Gaussian Splatting Avatar
di: Zong, Yeheng, et al.
Pubblicazione: (2026)
di: Zong, Yeheng, et al.
Pubblicazione: (2026)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
di: Peng, Tianfan, et al.
Pubblicazione: (2025)
di: Peng, Tianfan, et al.
Pubblicazione: (2025)
Dynamic Updates for Language Adaptation in Visual-Language Tracking
di: Li, Xiaohai, et al.
Pubblicazione: (2025)
di: Li, Xiaohai, et al.
Pubblicazione: (2025)
COMO: Closed-Loop Optical Molecule Recognition with Minimum Risk Training
di: Lyu, Zhuoqi, et al.
Pubblicazione: (2026)
di: Lyu, Zhuoqi, et al.
Pubblicazione: (2026)
MRStyle: A Unified Framework for Color Style Transfer with Multi-Modality Reference
di: Huang, Jiancheng, et al.
Pubblicazione: (2024)
di: Huang, Jiancheng, et al.
Pubblicazione: (2024)
HRVDA: High-Resolution Visual Document Assistant
di: Liu, Chaohu, et al.
Pubblicazione: (2024)
di: Liu, Chaohu, et al.
Pubblicazione: (2024)
Ctrl123: Consistent Novel View Synthesis via Closed-Loop Transcription
di: Zhao, Hongxiang, et al.
Pubblicazione: (2024)
di: Zhao, Hongxiang, et al.
Pubblicazione: (2024)
Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation
di: Ma, Jiahua, et al.
Pubblicazione: (2026)
di: Ma, Jiahua, et al.
Pubblicazione: (2026)
Visual-Inertial SLAM for Unstructured Outdoor Environments: Benchmarking the Benefits and Computational Costs of Loop Closing
di: Schmidt, Fabian, et al.
Pubblicazione: (2024)
di: Schmidt, Fabian, et al.
Pubblicazione: (2024)
MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning
di: Mi, Yapeng, et al.
Pubblicazione: (2025)
di: Mi, Yapeng, et al.
Pubblicazione: (2025)
Closed-Loop Transfer for Weakly-supervised Affordance Grounding
di: Tang, Jiajin, et al.
Pubblicazione: (2025)
di: Tang, Jiajin, et al.
Pubblicazione: (2025)
PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
di: Lin, Weifeng, et al.
Pubblicazione: (2024)
di: Lin, Weifeng, et al.
Pubblicazione: (2024)
Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation
di: Zhu, Ziyu, et al.
Pubblicazione: (2025)
di: Zhu, Ziyu, et al.
Pubblicazione: (2025)
Probing Visual Planning in Image Editing Models
di: Zhou, Zhimu, et al.
Pubblicazione: (2026)
di: Zhou, Zhimu, et al.
Pubblicazione: (2026)
Adaptive Visual Navigation Assistant in 3D RPGs
di: Xu, Kaijie, et al.
Pubblicazione: (2025)
di: Xu, Kaijie, et al.
Pubblicazione: (2025)
FAR-Drive: Frame-AutoRegressive Video Generation in Closed-Loop Autonomous Driving
di: Li, Yaoru, et al.
Pubblicazione: (2026)
di: Li, Yaoru, et al.
Pubblicazione: (2026)
HiDrive: A Closed-Loop Benchmark for High-Level Autonomous Driving
di: Xia, Zhongyu, et al.
Pubblicazione: (2026)
di: Xia, Zhongyu, et al.
Pubblicazione: (2026)
Hydra-NeXt: Robust Closed-Loop Driving with Open-Loop Training
di: Li, Zhenxin, et al.
Pubblicazione: (2025)
di: Li, Zhenxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
di: Li, Pengxiang, et al.
Pubblicazione: (2025) -
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
di: Gao, Zhi, et al.
Pubblicazione: (2024) -
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
di: Fan, Yue, et al.
Pubblicazione: (2024) -
Building LLM Agents by Incorporating Insights from Computer Systems
di: Mi, Yapeng, et al.
Pubblicazione: (2025) -
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
di: Zhang, Xintong, et al.
Pubblicazione: (2025)