Saved in:
| Main Authors: | Wang, Shuting, Liu, Yunqi, Yang, Zixin, Hu, Ning, Dou, Zhicheng, Xiong, Chenyan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2506.01689 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Generate, Not Recommend: Personalized Multimodal Content Generation
by: Liu, Jiongnan, et al.
Published: (2025)
by: Liu, Jiongnan, et al.
Published: (2025)
ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
by: Kang, Hao, et al.
Published: (2024)
by: Kang, Hao, et al.
Published: (2024)
Understand User Opinions of Large Language Models via LLM-Powered In-the-Moment User Experience Interviews
by: Liu, Mengqiao, et al.
Published: (2025)
by: Liu, Mengqiao, et al.
Published: (2025)
RAGViz: Diagnose and Visualize Retrieval-Augmented Generation
by: Wang, Tevin, et al.
Published: (2024)
by: Wang, Tevin, et al.
Published: (2024)
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
by: Hu, Yuyang, et al.
Published: (2026)
by: Hu, Yuyang, et al.
Published: (2026)
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
by: Yu, Zichun, et al.
Published: (2026)
by: Yu, Zichun, et al.
Published: (2026)
AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning
by: Wang, Tevin, et al.
Published: (2025)
by: Wang, Tevin, et al.
Published: (2025)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
by: Xiong, Zixin, et al.
Published: (2026)
by: Xiong, Zixin, et al.
Published: (2026)
Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents
by: Chopra, Harshita, et al.
Published: (2026)
by: Chopra, Harshita, et al.
Published: (2026)
ATG: Benchmarking Automated Theorem Generation for Generative Language Models
by: Lin, Xiaohan, et al.
Published: (2024)
by: Lin, Xiaohan, et al.
Published: (2024)
Montessori-Instruct: Generate Influential Training Data Tailored for Student Learning
by: Li, Xiaochuan, et al.
Published: (2024)
by: Li, Xiaochuan, et al.
Published: (2024)
Beyond Context: Large Language Models' Failure to Grasp Users' Intent
by: Hussain, Ahmed M., et al.
Published: (2025)
by: Hussain, Ahmed M., et al.
Published: (2025)
Toolink: Linking Toolkit Creation and Using through Chain-of-Solving on Open-Source Model
by: Qian, Cheng, et al.
Published: (2023)
by: Qian, Cheng, et al.
Published: (2023)
AssistRAG: Boosting the Potential of Large Language Models with an Intelligent Information Assistant
by: Zhou, Yujia, et al.
Published: (2024)
by: Zhou, Yujia, et al.
Published: (2024)
Benchmark Test-Time Scaling of General LLM Agents
by: Li, Xiaochuan, et al.
Published: (2026)
by: Li, Xiaochuan, et al.
Published: (2026)
Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models
by: Wang, Shuting, et al.
Published: (2025)
by: Wang, Shuting, et al.
Published: (2025)
Using Large Language Models to Generate, Validate, and Apply User Intent Taxonomies
by: Shah, Chirag, et al.
Published: (2023)
by: Shah, Chirag, et al.
Published: (2023)
ProRAG: Process-Supervised Reinforcement Learning for Retrieval-Augmented Generation
by: Wang, Zhao, et al.
Published: (2026)
by: Wang, Zhao, et al.
Published: (2026)
ShizishanGPT: An Agricultural Large Language Model Integrating Tools and Resources
by: Yang, Shuting, et al.
Published: (2024)
by: Yang, Shuting, et al.
Published: (2024)
Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations
by: Zheng, Mingqian, et al.
Published: (2026)
by: Zheng, Mingqian, et al.
Published: (2026)
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
by: Hao, Yijie, et al.
Published: (2025)
by: Hao, Yijie, et al.
Published: (2025)
Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and Reasoning
by: Hu, Yuyang, et al.
Published: (2026)
by: Hu, Yuyang, et al.
Published: (2026)
The Collective Turing Test: Large Language Models Can Generate Realistic Multi-User Discussions
by: Bouleimen, Azza, et al.
Published: (2025)
by: Bouleimen, Azza, et al.
Published: (2025)
GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
by: Mao, Hangyu, et al.
Published: (2025)
by: Mao, Hangyu, et al.
Published: (2025)
Language Models are Few-Shot Graders
by: Zhao, Chenyan, et al.
Published: (2025)
by: Zhao, Chenyan, et al.
Published: (2025)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
by: Du, Yiyang, et al.
Published: (2026)
by: Du, Yiyang, et al.
Published: (2026)
Beyond Pass-by-Pass Optimization: Intent-Driven IR Optimization with Large Language Models
by: Qiu, Lei, et al.
Published: (2026)
by: Qiu, Lei, et al.
Published: (2026)
Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
by: Zhang, Chenghao, et al.
Published: (2026)
by: Zhang, Chenghao, et al.
Published: (2026)
OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations
by: Chen, Jiangwang, et al.
Published: (2026)
by: Chen, Jiangwang, et al.
Published: (2026)
GLARE: Agentic Reasoning for Legal Judgment Prediction
by: Yang, Xinyu, et al.
Published: (2025)
by: Yang, Xinyu, et al.
Published: (2025)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
by: Li, Junlong, et al.
Published: (2025)
by: Li, Junlong, et al.
Published: (2025)
ED-Copilot: Reduce Emergency Department Wait Time with Language Model Diagnostic Assistance
by: Sun, Liwen, et al.
Published: (2024)
by: Sun, Liwen, et al.
Published: (2024)
TimelineReasoner: Advancing Timeline Summarization with Large Reasoning Models
by: Zhang, Liancheng, et al.
Published: (2026)
by: Zhang, Liancheng, et al.
Published: (2026)
Grounding Language Model with Chunking-Free In-Context Retrieval
by: Qian, Hongjin, et al.
Published: (2024)
by: Qian, Hongjin, et al.
Published: (2024)
Towards Mixed-Modal Retrieval for Universal Retrieval-Augmented Generation
by: Zhang, Chenghao, et al.
Published: (2025)
by: Zhang, Chenghao, et al.
Published: (2025)
SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels
by: Du, Guancheng, et al.
Published: (2025)
by: Du, Guancheng, et al.
Published: (2025)
MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
by: Wu, Zijian, et al.
Published: (2025)
by: Wu, Zijian, et al.
Published: (2025)
Linking Knowledge to Care: Knowledge Graph-Augmented Medical Follow-Up Question Generation
by: Sun, Liwen, et al.
Published: (2026)
by: Sun, Liwen, et al.
Published: (2026)
UserSumBench: A Benchmark Framework for Evaluating User Summarization Approaches
by: Wang, Chao, et al.
Published: (2024)
by: Wang, Chao, et al.
Published: (2024)
The Potential of LLMs in Medical Education: Generating Questions and Answers for Qualification Exams
by: Zhu, Yunqi, et al.
Published: (2024)
by: Zhu, Yunqi, et al.
Published: (2024)
Similar Items
-
Generate, Not Recommend: Personalized Multimodal Content Generation
by: Liu, Jiongnan, et al.
Published: (2025) -
ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
by: Kang, Hao, et al.
Published: (2024) -
Understand User Opinions of Large Language Models via LLM-Powered In-the-Moment User Experience Interviews
by: Liu, Mengqiao, et al.
Published: (2025) -
RAGViz: Diagnose and Visualize Retrieval-Augmented Generation
by: Wang, Tevin, et al.
Published: (2024) -
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
by: Hu, Yuyang, et al.
Published: (2026)