Hierarchical Auto-Organizing System for Open-Ended Multi-Agent Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Zhonghan, Chen, Kewei, Guo, Dongxu, Chai, Wenhao, Ye, Tian, Zhang, Yanting, Wang, Gaoang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
STEVE Series: Step-by-Step Construction of Agent Systems in Minecraft
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
di: Xu, Weili, et al.
Pubblicazione: (2025)
di: Xu, Weili, et al.
Pubblicazione: (2025)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024)
di: Song, Enxin, et al.
Pubblicazione: (2024)
CityCraft: A Real Crafter for 3D City Generation
di: Deng, Jie, et al.
Pubblicazione: (2024)
di: Deng, Jie, et al.
Pubblicazione: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
Ego3DT: Tracking Every 3D Object in Ego-centric Videos
di: Hao, Shengyu, et al.
Pubblicazione: (2024)
di: Hao, Shengyu, et al.
Pubblicazione: (2024)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
di: Song, Enxin, et al.
Pubblicazione: (2023)
di: Song, Enxin, et al.
Pubblicazione: (2023)
User-Aware Prefix-Tuning is a Good Learner for Personalized Image Captioning
di: Wang, Xuan, et al.
Pubblicazione: (2023)
di: Wang, Xuan, et al.
Pubblicazione: (2023)
DynaHOI: Benchmarking Hand-Object Interaction for Dynamic Target
di: Hu, BoCheng, et al.
Pubblicazione: (2026)
di: Hu, BoCheng, et al.
Pubblicazione: (2026)
VersaT2I: Improving Text-to-Image Models with Versatile Reward
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
di: Song, Enxin, et al.
Pubblicazione: (2025)
di: Song, Enxin, et al.
Pubblicazione: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
Blind Inpainting with Object-aware Discrimination for Artificial Marker Removal
di: Guo, Xuechen, et al.
Pubblicazione: (2023)
di: Guo, Xuechen, et al.
Pubblicazione: (2023)
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
CityGen: Infinite and Controllable City Layout Generation
di: Deng, Jie, et al.
Pubblicazione: (2023)
di: Deng, Jie, et al.
Pubblicazione: (2023)
DSG-World: Learning a 3D Gaussian World Model from Dual State Videos
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting
di: Zhou, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zhou, Xiaoyu, et al.
Pubblicazione: (2025)
Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles
di: Liu, Jiawei, et al.
Pubblicazione: (2026)
di: Liu, Jiawei, et al.
Pubblicazione: (2026)
E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding
di: Liu, Ye, et al.
Pubblicazione: (2024)
di: Liu, Ye, et al.
Pubblicazione: (2024)
Open-Det: An Efficient Learning Framework for Open-Ended Detection
di: Cao, Guiping, et al.
Pubblicazione: (2025)
di: Cao, Guiping, et al.
Pubblicazione: (2025)
RIG: Synergizing Reasoning and Imagination in End-to-End Generalist Policy
di: Zhao, Zhonghan, et al.
Pubblicazione: (2025)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2025)
OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic
di: Zhang, Songyan, et al.
Pubblicazione: (2025)
di: Zhang, Songyan, et al.
Pubblicazione: (2025)
Hi-LSplat: Hierarchical 3D Language Gaussian Splatting
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
Disjoint Contrastive Regression Learning for Multi-Sourced Annotations
di: Ruan, Xiaoqian, et al.
Pubblicazione: (2021)
di: Ruan, Xiaoqian, et al.
Pubblicazione: (2021)
Hand3R: Online 4D Hand-Scene Reconstruction in the Wild
di: Hu, Wendi, et al.
Pubblicazione: (2026)
di: Hu, Wendi, et al.
Pubblicazione: (2026)
AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models
di: Wang, Teng, et al.
Pubblicazione: (2026)
di: Wang, Teng, et al.
Pubblicazione: (2026)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
di: Wang, Gaoang, et al.
Pubblicazione: (2022)
di: Wang, Gaoang, et al.
Pubblicazione: (2022)
AutoDirector: Online Auto-scheduling Agents for Multi-sensory Composition
di: Ni, Minheng, et al.
Pubblicazione: (2024)
di: Ni, Minheng, et al.
Pubblicazione: (2024)
IGFuse: Interactive 3D Gaussian Scene Reconstruction via Multi-Scans Fusion
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
Towards Open-Ended Visual Scientific Discovery with Sparse Autoencoders
di: Stevens, Samuel, et al.
Pubblicazione: (2025)
di: Stevens, Samuel, et al.
Pubblicazione: (2025)
Generative Region-Language Pretraining for Open-Ended Object Detection
di: Lin, Chuang, et al.
Pubblicazione: (2024)
di: Lin, Chuang, et al.
Pubblicazione: (2024)
MCU: An Evaluation Framework for Open-Ended Game Agents
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
di: Yue, Junrong, et al.
Pubblicazione: (2025)
di: Yue, Junrong, et al.
Pubblicazione: (2025)
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
di: Liang, Tianming, et al.
Pubblicazione: (2024)
di: Liang, Tianming, et al.
Pubblicazione: (2024)
MediX-R1: Open Ended Medical Reinforcement Learning
di: Mullappilly, Sahal Shaji, et al.
Pubblicazione: (2026)
di: Mullappilly, Sahal Shaji, et al.
Pubblicazione: (2026)
ARGS: Auto-Regressive Gaussian Splatting via Parallel Progressive Next-Scale Prediction
di: Ruan, Quanyuan, et al.
Pubblicazione: (2026)
di: Ruan, Quanyuan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
STEVE Series: Step-by-Step Construction of Agent Systems in Minecraft
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024) -
Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024) -
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
di: Xu, Weili, et al.
Pubblicazione: (2025) -
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024) -
CityCraft: A Real Crafter for 3D City Generation
di: Deng, Jie, et al.
Pubblicazione: (2024)