Guardado en:
| Autores principales: | Zheng, Xinyue, Lin, Haowei, He, Kaichen, Wang, Zihao, Zheng, Zilong, Liang, Yitao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2310.08367 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
por: Li, Muyao, et al.
Publicado: (2025)
por: Li, Muyao, et al.
Publicado: (2025)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
por: Li, Hengzhi, et al.
Publicado: (2025)
por: Li, Hengzhi, et al.
Publicado: (2025)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
Open-World Skill Discovery from Unsegmented Demonstrations
por: Deng, Jingwen, et al.
Publicado: (2025)
por: Deng, Jingwen, et al.
Publicado: (2025)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
por: He, Zheqi, et al.
Publicado: (2025)
por: He, Zheqi, et al.
Publicado: (2025)
In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models
por: Earle, Sam, et al.
Publicado: (2026)
por: Earle, Sam, et al.
Publicado: (2026)
Agent S: An Open Agentic Framework that Uses Computers Like a Human
por: Agashe, Saaket, et al.
Publicado: (2024)
por: Agashe, Saaket, et al.
Publicado: (2024)
Contextual Experience Replay for Self-Improvement of Language Agents
por: Liu, Yitao, et al.
Publicado: (2025)
por: Liu, Yitao, et al.
Publicado: (2025)
Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
por: Zhang, Fan, et al.
Publicado: (2024)
por: Zhang, Fan, et al.
Publicado: (2024)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents
por: Zheng, Kaizhi, et al.
Publicado: (2022)
por: Zheng, Kaizhi, et al.
Publicado: (2022)
MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions
por: Zhang, Kai, et al.
Publicado: (2024)
por: Zhang, Kai, et al.
Publicado: (2024)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
por: Zhang, Wanpeng, et al.
Publicado: (2024)
por: Zhang, Wanpeng, et al.
Publicado: (2024)
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
por: Cheng, Kanzhi, et al.
Publicado: (2026)
por: Cheng, Kanzhi, et al.
Publicado: (2026)
Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
por: Ye, Junyan, et al.
Publicado: (2025)
por: Ye, Junyan, et al.
Publicado: (2025)
WebGuard: Building a Generalizable Guardrail for Web Agents
por: Zheng, Boyuan, et al.
Publicado: (2025)
por: Zheng, Boyuan, et al.
Publicado: (2025)
Holistic Evaluation for Interleaved Text-and-Image Generation
por: Liu, Minqian, et al.
Publicado: (2024)
por: Liu, Minqian, et al.
Publicado: (2024)
Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
por: Zhao, Haozhe, et al.
Publicado: (2026)
por: Zhao, Haozhe, et al.
Publicado: (2026)
Probing and Inducing Combinational Creativity in Vision-Language Models
por: Peng, Yongqian, et al.
Publicado: (2025)
por: Peng, Yongqian, et al.
Publicado: (2025)
Evaluating the Correctness of Inference Patterns Used by LLMs for Judgment
por: Chen, Lu, et al.
Publicado: (2024)
por: Chen, Lu, et al.
Publicado: (2024)
ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context Prompting
por: Cai, Shaofei, et al.
Publicado: (2024)
por: Cai, Shaofei, et al.
Publicado: (2024)
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
por: Ouyang, Mingyu, et al.
Publicado: (2026)
por: Ouyang, Mingyu, et al.
Publicado: (2026)
GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
por: Wang, Yunzhe, et al.
Publicado: (2026)
por: Wang, Yunzhe, et al.
Publicado: (2026)
v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
por: Shi, Zhengpeng, et al.
Publicado: (2025)
por: Shi, Zhengpeng, et al.
Publicado: (2025)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
por: Liu, Daixian, et al.
Publicado: (2026)
por: Liu, Daixian, et al.
Publicado: (2026)
ADAM: An Embodied Causal Agent in Open-World Environments
por: Yu, Shu, et al.
Publicado: (2024)
por: Yu, Shu, et al.
Publicado: (2024)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
por: Zhao, Yilun, et al.
Publicado: (2025)
por: Zhao, Yilun, et al.
Publicado: (2025)
Revisiting the Role of Language Priors in Vision-Language Models
por: Lin, Zhiqiu, et al.
Publicado: (2023)
por: Lin, Zhiqiu, et al.
Publicado: (2023)
UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection
por: Sun, Fuxiang, et al.
Publicado: (2026)
por: Sun, Fuxiang, et al.
Publicado: (2026)
Bridging Coarse and Fine Recognition: A Hybrid Approach for Open-Ended Multi-Granularity Object Recognition in Interactive Educational Games
por: Yi, Hanling, et al.
Publicado: (2026)
por: Yi, Hanling, et al.
Publicado: (2026)
The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
por: Hu, Siyuan, et al.
Publicado: (2024)
por: Hu, Siyuan, et al.
Publicado: (2024)
CLoG: Benchmarking Continual Learning of Image Generation Models
por: Zhang, Haotian, et al.
Publicado: (2024)
por: Zhang, Haotian, et al.
Publicado: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
por: Liu, Xiao, et al.
Publicado: (2024)
por: Liu, Xiao, et al.
Publicado: (2024)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
por: He, Xuehai, et al.
Publicado: (2024)
por: He, Xuehai, et al.
Publicado: (2024)
From Summary to Action: Enhancing Large Language Models for Complex Tasks with Open World APIs
por: Liu, Yulong, et al.
Publicado: (2024)
por: Liu, Yulong, et al.
Publicado: (2024)
DermaVQA-DAS: Dermatology Assessment Schema (DAS) & Datasets for Closed-Ended Question Answering & Segmentation in Patient-Generated Dermatology Images
por: Yim, Wen-wai, et al.
Publicado: (2025)
por: Yim, Wen-wai, et al.
Publicado: (2025)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
por: Zhang, Haowei, et al.
Publicado: (2026)
por: Zhang, Haowei, et al.
Publicado: (2026)
FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games
por: Ahn, Jaewoo, et al.
Publicado: (2025)
por: Ahn, Jaewoo, et al.
Publicado: (2025)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
por: Du, Yang, et al.
Publicado: (2025)
por: Du, Yang, et al.
Publicado: (2025)
Ejemplares similares
-
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
por: Li, Muyao, et al.
Publicado: (2025) -
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
por: Li, Hengzhi, et al.
Publicado: (2025) -
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
por: Yao, Huanjin, et al.
Publicado: (2025) -
Open-World Skill Discovery from Unsegmented Demonstrations
por: Deng, Jingwen, et al.
Publicado: (2025) -
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
por: He, Zheqi, et al.
Publicado: (2025)