Enregistré dans:
| Auteurs principaux: | Zheng, Xinyue, Lin, Haowei, He, Kaichen, Wang, Zihao, Zheng, Zilong, Liang, Yitao |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2310.08367 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
par: Li, Muyao, et autres
Publié: (2025)
par: Li, Muyao, et autres
Publié: (2025)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
par: Li, Hengzhi, et autres
Publié: (2025)
par: Li, Hengzhi, et autres
Publié: (2025)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
par: Yao, Huanjin, et autres
Publié: (2025)
par: Yao, Huanjin, et autres
Publié: (2025)
Open-World Skill Discovery from Unsegmented Demonstrations
par: Deng, Jingwen, et autres
Publié: (2025)
par: Deng, Jingwen, et autres
Publié: (2025)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
par: He, Zheqi, et autres
Publié: (2025)
par: He, Zheqi, et autres
Publié: (2025)
In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models
par: Earle, Sam, et autres
Publié: (2026)
par: Earle, Sam, et autres
Publié: (2026)
Agent S: An Open Agentic Framework that Uses Computers Like a Human
par: Agashe, Saaket, et autres
Publié: (2024)
par: Agashe, Saaket, et autres
Publié: (2024)
Contextual Experience Replay for Self-Improvement of Language Agents
par: Liu, Yitao, et autres
Publié: (2025)
par: Liu, Yitao, et autres
Publié: (2025)
Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
par: Zhang, Fan, et autres
Publié: (2024)
par: Zhang, Fan, et autres
Publié: (2024)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents
par: Zheng, Kaizhi, et autres
Publié: (2022)
par: Zheng, Kaizhi, et autres
Publié: (2022)
MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions
par: Zhang, Kai, et autres
Publié: (2024)
par: Zhang, Kai, et autres
Publié: (2024)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
par: Zhang, Wanpeng, et autres
Publié: (2024)
par: Zhang, Wanpeng, et autres
Publié: (2024)
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
par: Cheng, Kanzhi, et autres
Publié: (2026)
par: Cheng, Kanzhi, et autres
Publié: (2026)
Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
par: Ye, Junyan, et autres
Publié: (2025)
par: Ye, Junyan, et autres
Publié: (2025)
WebGuard: Building a Generalizable Guardrail for Web Agents
par: Zheng, Boyuan, et autres
Publié: (2025)
par: Zheng, Boyuan, et autres
Publié: (2025)
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)
par: Liu, Minqian, et autres
Publié: (2024)
Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
par: Zhao, Haozhe, et autres
Publié: (2026)
par: Zhao, Haozhe, et autres
Publié: (2026)
Probing and Inducing Combinational Creativity in Vision-Language Models
par: Peng, Yongqian, et autres
Publié: (2025)
par: Peng, Yongqian, et autres
Publié: (2025)
Evaluating the Correctness of Inference Patterns Used by LLMs for Judgment
par: Chen, Lu, et autres
Publié: (2024)
par: Chen, Lu, et autres
Publié: (2024)
ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context Prompting
par: Cai, Shaofei, et autres
Publié: (2024)
par: Cai, Shaofei, et autres
Publié: (2024)
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
par: Ouyang, Mingyu, et autres
Publié: (2026)
par: Ouyang, Mingyu, et autres
Publié: (2026)
GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
par: Wang, Yunzhe, et autres
Publié: (2026)
par: Wang, Yunzhe, et autres
Publié: (2026)
v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
par: Shi, Zhengpeng, et autres
Publié: (2025)
par: Shi, Zhengpeng, et autres
Publié: (2025)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
par: Liu, Daixian, et autres
Publié: (2026)
par: Liu, Daixian, et autres
Publié: (2026)
ADAM: An Embodied Causal Agent in Open-World Environments
par: Yu, Shu, et autres
Publié: (2024)
par: Yu, Shu, et autres
Publié: (2024)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
par: Zhao, Yilun, et autres
Publié: (2025)
par: Zhao, Yilun, et autres
Publié: (2025)
Revisiting the Role of Language Priors in Vision-Language Models
par: Lin, Zhiqiu, et autres
Publié: (2023)
par: Lin, Zhiqiu, et autres
Publié: (2023)
UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection
par: Sun, Fuxiang, et autres
Publié: (2026)
par: Sun, Fuxiang, et autres
Publié: (2026)
Bridging Coarse and Fine Recognition: A Hybrid Approach for Open-Ended Multi-Granularity Object Recognition in Interactive Educational Games
par: Yi, Hanling, et autres
Publié: (2026)
par: Yi, Hanling, et autres
Publié: (2026)
The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
par: Hu, Siyuan, et autres
Publié: (2024)
par: Hu, Siyuan, et autres
Publié: (2024)
CLoG: Benchmarking Continual Learning of Image Generation Models
par: Zhang, Haotian, et autres
Publié: (2024)
par: Zhang, Haotian, et autres
Publié: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
par: He, Xuehai, et autres
Publié: (2024)
par: He, Xuehai, et autres
Publié: (2024)
From Summary to Action: Enhancing Large Language Models for Complex Tasks with Open World APIs
par: Liu, Yulong, et autres
Publié: (2024)
par: Liu, Yulong, et autres
Publié: (2024)
DermaVQA-DAS: Dermatology Assessment Schema (DAS) & Datasets for Closed-Ended Question Answering & Segmentation in Patient-Generated Dermatology Images
par: Yim, Wen-wai, et autres
Publié: (2025)
par: Yim, Wen-wai, et autres
Publié: (2025)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
par: Zhang, Haowei, et autres
Publié: (2026)
par: Zhang, Haowei, et autres
Publié: (2026)
FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games
par: Ahn, Jaewoo, et autres
Publié: (2025)
par: Ahn, Jaewoo, et autres
Publié: (2025)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
par: Du, Yang, et autres
Publié: (2025)
par: Du, Yang, et autres
Publié: (2025)
Documents similaires
-
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
par: Li, Muyao, et autres
Publié: (2025) -
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
par: Li, Hengzhi, et autres
Publié: (2025) -
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
par: Yao, Huanjin, et autres
Publié: (2025) -
Open-World Skill Discovery from Unsegmented Demonstrations
par: Deng, Jingwen, et autres
Publié: (2025) -
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
par: He, Zheqi, et autres
Publié: (2025)