$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Haoran, Xu, Luxin, Wang, Zhilin, Gui, Runquan, Zhang, Shunkai, Lei, Haodi, He, Zihao, He, Bingsu, Qin, Chicheng, Zhu, Tong, Qu, Xiaoye, Yang, Yang, Cheng, Yu, Li, Yafu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
por: Wang, Zhilin, et al.
Publicado: (2026)
por: Wang, Zhilin, et al.
Publicado: (2026)
Characterizing, Evaluating, and Optimizing Complex Reasoning
por: Zhang, Haoran, et al.
Publicado: (2026)
por: Zhang, Haoran, et al.
Publicado: (2026)
FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization
por: Gui, Runquan, et al.
Publicado: (2026)
por: Gui, Runquan, et al.
Publicado: (2026)
Draft-OPD: On-Policy Distillation for Speculative Draft Models
por: Lei, Haodi, et al.
Publicado: (2026)
por: Lei, Haodi, et al.
Publicado: (2026)
SEE: Continual Fine-tuning with Sequential Ensemble of Experts
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
GEMS: Agent-Native Multimodal Generation with Memory and Skills
por: He, Zefeng, et al.
Publicado: (2026)
por: He, Zefeng, et al.
Publicado: (2026)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
por: He, Zefeng, et al.
Publicado: (2025)
por: He, Zefeng, et al.
Publicado: (2025)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
por: Li, Shuyue Stella, et al.
Publicado: (2026)
por: Li, Shuyue Stella, et al.
Publicado: (2026)
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
por: He, Zefeng, et al.
Publicado: (2025)
por: He, Zefeng, et al.
Publicado: (2025)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
por: Gao, Yuxuan, et al.
Publicado: (2026)
por: Gao, Yuxuan, et al.
Publicado: (2026)
VideoSSR: Video Self-Supervised Reinforcement Learning
por: He, Zefeng, et al.
Publicado: (2025)
por: He, Zefeng, et al.
Publicado: (2025)
Towards an AI Musician: Synthesizing Sheet Music Problems for Musical Reasoning
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
por: Chen, Xueyao, et al.
Publicado: (2026)
por: Chen, Xueyao, et al.
Publicado: (2026)
LatentMem: Customizing Latent Memory for Multi-Agent Systems
por: Fu, Muxin, et al.
Publicado: (2026)
por: Fu, Muxin, et al.
Publicado: (2026)
Memento: Towards Proactive Visualization of Everyday Memories with Personal Wearable AR Assistant
por: Kim, Yoonsang, et al.
Publicado: (2026)
por: Kim, Yoonsang, et al.
Publicado: (2026)
Modeling Long Sequences in Bladder Cancer Recurrence: A Comparative Evaluation of LSTM,Transformer,and Mamba
por: Zhang, Runquan, et al.
Publicado: (2024)
por: Zhang, Runquan, et al.
Publicado: (2024)
Spotlight on Token Perception for Multimodal Reinforcement Learning
por: Huang, Siyuan, et al.
Publicado: (2025)
por: Huang, Siyuan, et al.
Publicado: (2025)
Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
por: Fu, Tingchen, et al.
Publicado: (2025)
por: Fu, Tingchen, et al.
Publicado: (2025)
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
por: Li, Yafu, et al.
Publicado: (2025)
por: Li, Yafu, et al.
Publicado: (2025)
The null condition in elastodynamics leads to non-uniqueness
por: Mao, Shunkai, et al.
Publicado: (2025)
por: Mao, Shunkai, et al.
Publicado: (2025)
Non-uniqueness for the nonlinear dynamical Lamé system
por: Mao, Shunkai, et al.
Publicado: (2025)
por: Mao, Shunkai, et al.
Publicado: (2025)
Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
por: Nathani, Deepak, et al.
Publicado: (2026)
por: Nathani, Deepak, et al.
Publicado: (2026)
OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows
por: Wang, Weixuan, et al.
Publicado: (2025)
por: Wang, Weixuan, et al.
Publicado: (2025)
LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation
por: Duan, Feiyu, et al.
Publicado: (2026)
por: Duan, Feiyu, et al.
Publicado: (2026)
Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM
por: Duong, Thang, et al.
Publicado: (2025)
por: Duong, Thang, et al.
Publicado: (2025)
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
por: Huang, Siyuan, et al.
Publicado: (2026)
por: Huang, Siyuan, et al.
Publicado: (2026)
CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
por: Chen, Haolin, et al.
Publicado: (2026)
por: Chen, Haolin, et al.
Publicado: (2026)
ProPerSim: Developing Proactive and Personalized AI Assistants through User-Assistant Simulation
por: Kim, Jiho, et al.
Publicado: (2025)
por: Kim, Jiho, et al.
Publicado: (2025)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
por: Ran, Dongchuan, et al.
Publicado: (2026)
por: Ran, Dongchuan, et al.
Publicado: (2026)
CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations
por: Gao, Huan-ang, et al.
Publicado: (2025)
por: Gao, Huan-ang, et al.
Publicado: (2025)
Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation
por: Zhang, Haoran, et al.
Publicado: (2025)
por: Zhang, Haoran, et al.
Publicado: (2025)
AgentFold: Long-Horizon Web Agents with Proactive Context Management
por: Ye, Rui, et al.
Publicado: (2025)
por: Ye, Rui, et al.
Publicado: (2025)
LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health
por: Tian, Ye, et al.
Publicado: (2026)
por: Tian, Ye, et al.
Publicado: (2026)
VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
por: Liao, Xinyao, et al.
Publicado: (2025)
por: Liao, Xinyao, et al.
Publicado: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
por: Wang, Chengyao, et al.
Publicado: (2025)
por: Wang, Chengyao, et al.
Publicado: (2025)
Designing Human-AI System for Legal Research: A Case Study of Precedent Search in Chinese Law
por: Guan, Jiarui, et al.
Publicado: (2025)
por: Guan, Jiarui, et al.
Publicado: (2025)
Efficient Active Learning Halfspaces with Tsybakov Noise: A Non-convex Optimization Approach
por: Li, Yinan, et al.
Publicado: (2023)
por: Li, Yinan, et al.
Publicado: (2023)
Towards Fundamental Limits for Active Multi-distribution Learning
por: Zhang, Chicheng, et al.
Publicado: (2025)
por: Zhang, Chicheng, et al.
Publicado: (2025)
Agnostic Interactive Imitation Learning: New Theory and Practical Algorithms
por: Li, Yichen, et al.
Publicado: (2023)
por: Li, Yichen, et al.
Publicado: (2023)
Taming the Monster Every Context: Complexity Measure and Unified Framework for Offline-Oracle Efficient Contextual Bandits
por: Qin, Hao, et al.
Publicado: (2026)
por: Qin, Hao, et al.
Publicado: (2026)
Ejemplares similares
-
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
por: Wang, Zhilin, et al.
Publicado: (2026) -
Characterizing, Evaluating, and Optimizing Complex Reasoning
por: Zhang, Haoran, et al.
Publicado: (2026) -
FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization
por: Gui, Runquan, et al.
Publicado: (2026) -
Draft-OPD: On-Policy Distillation for Speculative Draft Models
por: Lei, Haodi, et al.
Publicado: (2026) -
SEE: Continual Fine-tuning with Sequential Ensemble of Experts
por: Wang, Zhilin, et al.
Publicado: (2025)