Towards Personalized Deep Research: Benchmarks and Evaluations
Fuente:
arXiv
Saved in:
| Main Authors: | Liang, Yuan, Li, Jiaxian, Wang, Yuqing, Wang, Piaohong, Tian, Motong, Liu, Pai, Qiao, Shuofei, Fang, Runnan, Zhu, He, Zhang, Ge, Liu, Minghao, Jiang, Yuchen Eleanor, Zhang, Ningyu, Zhou, Wangchunshu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
O-Mem: Omni Memory System for Personalized, Long Horizon, Self-Evolving Agents
by: Wang, Piaohong, et al.
Published: (2025)
by: Wang, Piaohong, et al.
Published: (2025)
AutoAct: Automatic Agent Learning from Scratch for QA via Self-Planning
by: Qiao, Shuofei, et al.
Published: (2024)
by: Qiao, Shuofei, et al.
Published: (2024)
Judging with Personality and Confidence: A Study on Personality-Conditioned LLM Relevance Assessment
by: Chen, Nuo, et al.
Published: (2026)
by: Chen, Nuo, et al.
Published: (2026)
EasyInstruct: An Easy-to-use Instruction Processing Framework for Large Language Models
by: Ou, Yixin, et al.
Published: (2024)
by: Ou, Yixin, et al.
Published: (2024)
Making Language Models Better Tool Learners with Execution Feedback
by: Qiao, Shuofei, et al.
Published: (2023)
by: Qiao, Shuofei, et al.
Published: (2023)
InstructIE: A Bilingual Instruction-based Information Extraction Dataset
by: Gui, Honghao, et al.
Published: (2023)
by: Gui, Honghao, et al.
Published: (2023)
LLMs for Knowledge Graph Construction and Reasoning: Recent Capabilities and Future Opportunities
by: Zhu, Yuqi, et al.
Published: (2023)
by: Zhu, Yuqi, et al.
Published: (2023)
LightThinker++: From Reasoning Compression to Memory Management
by: Zhu, Yuqi, et al.
Published: (2026)
by: Zhu, Yuqi, et al.
Published: (2026)
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
by: Qiao, Shuofei, et al.
Published: (2026)
by: Qiao, Shuofei, et al.
Published: (2026)
LightThinker: Thinking Step-by-Step Compression
by: Zhang, Jintian, et al.
Published: (2025)
by: Zhang, Jintian, et al.
Published: (2025)
SkillX: Automatically Constructing Skill Knowledge Bases for Agents
by: Wang, Chenxi, et al.
Published: (2026)
by: Wang, Chenxi, et al.
Published: (2026)
Scaling Generalist Data-Analytic Agents
by: Qiao, Shuofei, et al.
Published: (2025)
by: Qiao, Shuofei, et al.
Published: (2025)
Graph-Sequential Alignment and Uniformity: Toward Enhanced Recommendation Systems
by: Cao, Yuwei, et al.
Published: (2024)
by: Cao, Yuwei, et al.
Published: (2024)
Towards Next-Generation Recommender Systems: A Benchmark for Personalized Recommendation Assistant with LLMs
by: Huang, Jiani, et al.
Published: (2025)
by: Huang, Jiani, et al.
Published: (2025)
Why Do Open-Source LLMs Struggle with Data Analysis? A Systematic Empirical Study
by: Zhu, Yuqi, et al.
Published: (2025)
by: Zhu, Yuqi, et al.
Published: (2025)
Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery
by: Li, Xiaopeng, et al.
Published: (2026)
by: Li, Xiaopeng, et al.
Published: (2026)
RAGRouter-Bench: A Dataset and Benchmark for Adaptive RAG Routing
by: Wang, Ziqi, et al.
Published: (2026)
by: Wang, Ziqi, et al.
Published: (2026)
PJB: A Reasoning-Aware Benchmark for Person-Job Retrieval
by: Wang, Guangzhi, et al.
Published: (2026)
by: Wang, Guangzhi, et al.
Published: (2026)
Benchmarking Agentic Workflow Generation
by: Qiao, Shuofei, et al.
Published: (2024)
by: Qiao, Shuofei, et al.
Published: (2024)
A Knowledge Graph and Deep Learning-Based Semantic Recommendation Database System for Advertisement Retrieval and Personalization
by: Wang, Tangtang, et al.
Published: (2025)
by: Wang, Tangtang, et al.
Published: (2025)
InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem
by: Qiao, Shuofei, et al.
Published: (2026)
by: Qiao, Shuofei, et al.
Published: (2026)
FollowTable: A Benchmark for Instruction-Following Table Retrieval
by: Jin, Rihui, et al.
Published: (2026)
by: Jin, Rihui, et al.
Published: (2026)
Discrete Preference Learning for Personalized Multimodal Generation
by: Zhang, Yuting, et al.
Published: (2026)
by: Zhang, Yuting, et al.
Published: (2026)
ALPBench: A Benchmark for Attribution-level Long-term Personal Behavior Understanding
by: Ren, Lu, et al.
Published: (2026)
by: Ren, Lu, et al.
Published: (2026)
AgentRecBench: Benchmarking LLM Agent-based Personalized Recommender Systems
by: Shang, Yu, et al.
Published: (2025)
by: Shang, Yu, et al.
Published: (2025)
On Evaluating the Adversarial Robustness of Foundation Models for Multimodal Entity Linking
by: Wang, Fang, et al.
Published: (2025)
by: Wang, Fang, et al.
Published: (2025)
Enhanced Bayesian Personalized Ranking for Robust Hard Negative Sampling in Recommender Systems
by: Shi, Kexin, et al.
Published: (2024)
by: Shi, Kexin, et al.
Published: (2024)
ChineseHarm-Bench: A Chinese Harmful Content Detection Benchmark
by: Liu, Kangwei, et al.
Published: (2025)
by: Liu, Kangwei, et al.
Published: (2025)
LLM Agents Enable User-Governed Personalization Beyond Platform Boundaries
by: Lin, Jiacheng, et al.
Published: (2026)
by: Lin, Jiacheng, et al.
Published: (2026)
GraphRAG-IRL: Personalized Recommendation with Graph-Grounded Inverse Reinforcement Learning and LLM Re-ranking
by: Liang, Siqi, et al.
Published: (2026)
by: Liang, Siqi, et al.
Published: (2026)
Towards A Unified View of Answer Calibration for Multi-Step Reasoning
by: Deng, Shumin, et al.
Published: (2023)
by: Deng, Shumin, et al.
Published: (2023)
MARCO: A Cooperative Knowledge Transfer Framework for Personalized Cross-domain Recommendations
by: Xie, Lili, et al.
Published: (2025)
by: Xie, Lili, et al.
Published: (2025)
Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework
by: Chen, Nuo, et al.
Published: (2025)
by: Chen, Nuo, et al.
Published: (2025)
UQABench: Evaluating User Embedding for Prompting LLMs in Personalized Question Answering
by: Liu, Langming, et al.
Published: (2025)
by: Liu, Langming, et al.
Published: (2025)
DeepRec: Towards a Deep Dive Into the Item Space with Large Language Model Based Recommendation
by: Zheng, Bowen, et al.
Published: (2025)
by: Zheng, Bowen, et al.
Published: (2025)
OmniThink: Expanding Knowledge Boundaries in Machine Writing through Thinking
by: Xi, Zekun, et al.
Published: (2025)
by: Xi, Zekun, et al.
Published: (2025)
Better Late Than Never: Formulating and Benchmarking Recommendation Editing
by: Lai, Chengyu, et al.
Published: (2024)
by: Lai, Chengyu, et al.
Published: (2024)
Towards On-Device Personalization: Cloud-device Collaborative Data Augmentation for Efficient On-device Language Model
by: Zhong, Zhaofeng, et al.
Published: (2025)
by: Zhong, Zhaofeng, et al.
Published: (2025)
Personalize Before Retrieve: LLM-based Personalized Query Expansion for User-Centric Retrieval
by: Zhang, Yingyi, et al.
Published: (2025)
by: Zhang, Yingyi, et al.
Published: (2025)
Personalized Multi-Interest Modeling for Cross-Domain Recommendation to Cold-Start Users
by: Li, Xiaodong, et al.
Published: (2026)
by: Li, Xiaodong, et al.
Published: (2026)
Similar Items
-
O-Mem: Omni Memory System for Personalized, Long Horizon, Self-Evolving Agents
by: Wang, Piaohong, et al.
Published: (2025) -
AutoAct: Automatic Agent Learning from Scratch for QA via Self-Planning
by: Qiao, Shuofei, et al.
Published: (2024) -
Judging with Personality and Confidence: A Study on Personality-Conditioned LLM Relevance Assessment
by: Chen, Nuo, et al.
Published: (2026) -
EasyInstruct: An Easy-to-use Instruction Processing Framework for Large Language Models
by: Ou, Yixin, et al.
Published: (2024) -
Making Language Models Better Tool Learners with Execution Feedback
by: Qiao, Shuofei, et al.
Published: (2023)