WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Chengzhi, Yang, Yuzhe, Pu, Sophia Xiao, Liu, Yepeng, Long, Lin, Guo, Yichen, Chen, Nuo, Weng, Zhaotian, Kochkina, Elena, Kaur, Simerjot, Smiley, Charese, Liu, Xiaomo, Zou, James, Liu, Sheng, Bu, Yuheng, Peng, Songyou, Wang, Xin Eric |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference Benchmarking
por: Magomere, Jabez, et al.
Publicado: (2025)
por: Magomere, Jabez, et al.
Publicado: (2025)
Distill and Align Decomposition for Enhanced Claim Verification
por: Magomere, Jabez, et al.
Publicado: (2026)
por: Magomere, Jabez, et al.
Publicado: (2026)
A Variational Approach for Mitigating Entity Bias in Relation Extraction
por: Mensah, Samuel, et al.
Publicado: (2025)
por: Mensah, Samuel, et al.
Publicado: (2025)
FinQAPT: Empowering Financial Decisions with End-to-End LLM-driven Question Answering Pipeline
por: Singh, Kuldeep, et al.
Publicado: (2024)
por: Singh, Kuldeep, et al.
Publicado: (2024)
Large Language Models as Financial Data Annotators: A Study on Effectiveness and Efficiency
por: Aguda, Toyin, et al.
Publicado: (2024)
por: Aguda, Toyin, et al.
Publicado: (2024)
Grounding LLM Reasoning with Knowledge Graphs
por: Amayuelas, Alfonso, et al.
Publicado: (2025)
por: Amayuelas, Alfonso, et al.
Publicado: (2025)
Conservative Bias in Large Language Models: Measuring Relation Predictions
por: Aguda, Toyin, et al.
Publicado: (2025)
por: Aguda, Toyin, et al.
Publicado: (2025)
Adaptive Text Watermark for Large Language Models
por: Liu, Yepeng, et al.
Publicado: (2024)
por: Liu, Yepeng, et al.
Publicado: (2024)
Auditing Agent Harness Safety
por: Liu, Chengzhi, et al.
Publicado: (2026)
por: Liu, Chengzhi, et al.
Publicado: (2026)
AI Analyst: Framework and Comprehensive Evaluation of Large Language Models for Financial Time Series Report Generation
por: Fons, Elizabeth, et al.
Publicado: (2025)
por: Fons, Elizabeth, et al.
Publicado: (2025)
Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking
por: Khanmohammadi, Reza, et al.
Publicado: (2026)
por: Khanmohammadi, Reza, et al.
Publicado: (2026)
How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains
por: Khanmohammadi, Reza, et al.
Publicado: (2026)
por: Khanmohammadi, Reza, et al.
Publicado: (2026)
The Influence of Biomedical Research on Future Business Funding: Analyzing Scientific Impact and Content in Industrial Investments
por: Khanmohammadi, Reza, et al.
Publicado: (2024)
por: Khanmohammadi, Reza, et al.
Publicado: (2024)
Calibrating LLM Confidence by Probing Perturbed Representation Stability
por: Khanmohammadi, Reza, et al.
Publicado: (2025)
por: Khanmohammadi, Reza, et al.
Publicado: (2025)
Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs
por: Liu, Yepeng, et al.
Publicado: (2025)
por: Liu, Yepeng, et al.
Publicado: (2025)
Deep FinResearch Bench: Evaluating AI's Ability to Conduct Professional Financial Investment Research
por: Haque, Mirazul, et al.
Publicado: (2026)
por: Haque, Mirazul, et al.
Publicado: (2026)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
por: An, Li, et al.
Publicado: (2025)
por: An, Li, et al.
Publicado: (2025)
In-Context Watermarks for Large Language Models
por: Liu, Yepeng, et al.
Publicado: (2025)
por: Liu, Yepeng, et al.
Publicado: (2025)
World Reasoning Arena
por: PAN Team, et al.
Publicado: (2026)
por: PAN Team, et al.
Publicado: (2026)
DocLLM: A layout-aware generative language model for multimodal document understanding
por: Wang, Dongsheng, et al.
Publicado: (2023)
por: Wang, Dongsheng, et al.
Publicado: (2023)
Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption
por: Liu, Yepeng, et al.
Publicado: (2025)
por: Liu, Yepeng, et al.
Publicado: (2025)
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
por: Zhang, Zhen, et al.
Publicado: (2026)
por: Zhang, Zhen, et al.
Publicado: (2026)
World Guidance: World Modeling in Condition Space for Action Generation
por: Su, Yue, et al.
Publicado: (2026)
por: Su, Yue, et al.
Publicado: (2026)
Pandora: Towards General World Model with Natural Language Actions and Video States
por: Xiang, Jiannan, et al.
Publicado: (2024)
por: Xiang, Jiannan, et al.
Publicado: (2024)
WorldMem: Long-term Consistent World Simulation with Memory
por: Xiao, Zeqi, et al.
Publicado: (2025)
por: Xiao, Zeqi, et al.
Publicado: (2025)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
por: Liu, Chengzhi, et al.
Publicado: (2025)
por: Liu, Chengzhi, et al.
Publicado: (2025)
Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps
por: Wang, Kangyu, et al.
Publicado: (2025)
por: Wang, Kangyu, et al.
Publicado: (2025)
PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World
por: Wang, Changpeng, et al.
Publicado: (2026)
por: Wang, Changpeng, et al.
Publicado: (2026)
What if? Emulative Simulation with World Models for Situated Reasoning
por: Liu, Ruiping, et al.
Publicado: (2026)
por: Liu, Ruiping, et al.
Publicado: (2026)
GigaWorld-Policy: An Efficient Action-Centered World--Action Model
por: Ye, Angen, et al.
Publicado: (2026)
por: Ye, Angen, et al.
Publicado: (2026)
Image Watermarks are Removable Using Controllable Regeneration from Clean Noise
por: Liu, Yepeng, et al.
Publicado: (2024)
por: Liu, Yepeng, et al.
Publicado: (2024)
Translating between SQL Dialects for Cloud Migration
por: Zmigrod, Ran, et al.
Publicado: (2024)
por: Zmigrod, Ran, et al.
Publicado: (2024)
Detecting Non-Membership in LLM Training Data via Rank Correlations
por: Shetty, Pranav, et al.
Publicado: (2026)
por: Shetty, Pranav, et al.
Publicado: (2026)
Images Speak Louder than Words: Understanding and Mitigating Bias in Vision-Language Model from a Causal Mediation Perspective
por: Weng, Zhaotian, et al.
Publicado: (2024)
por: Weng, Zhaotian, et al.
Publicado: (2024)
VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning
por: Ji, Yuheng, et al.
Publicado: (2025)
por: Ji, Yuheng, et al.
Publicado: (2025)
WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
por: Shang, Yu, et al.
Publicado: (2026)
por: Shang, Yu, et al.
Publicado: (2026)
Best-of-Both-Worlds Fair Allocation of Indivisible and Mixed Goods
por: Bu, Xiaolin, et al.
Publicado: (2024)
por: Bu, Xiaolin, et al.
Publicado: (2024)
WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
por: Shang, Yu, et al.
Publicado: (2026)
por: Shang, Yu, et al.
Publicado: (2026)
UniVer: A Unified Perspective for Multi-step and Multi-draft Speculative Decoding
por: Weng, Yepeng, et al.
Publicado: (2026)
por: Weng, Yepeng, et al.
Publicado: (2026)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
Ejemplares similares
-
FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference Benchmarking
por: Magomere, Jabez, et al.
Publicado: (2025) -
Distill and Align Decomposition for Enhanced Claim Verification
por: Magomere, Jabez, et al.
Publicado: (2026) -
A Variational Approach for Mitigating Entity Bias in Relation Extraction
por: Mensah, Samuel, et al.
Publicado: (2025) -
FinQAPT: Empowering Financial Decisions with End-to-End LLM-driven Question Answering Pipeline
por: Singh, Kuldeep, et al.
Publicado: (2024) -
Large Language Models as Financial Data Annotators: A Study on Effectiveness and Efficiency
por: Aguda, Toyin, et al.
Publicado: (2024)