Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Lv, Changze, Zhou, Jie, Zhao, Wentao, Xu, Jingwen, Dou, Shihan, Huang, Zisu, Tian, Muzhao, Wang, Xiaohua, Liu, Yang, Zhou, Pluto, Gui, Tao, Tian, Le, Zhou, Xiao, Zheng, Xiaoqing, Huang, Xuanjing |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CSSG: Measuring Code Similarity with Semantic Graphs
by: Lu, Yiyang, et al.
Published: (2026)
by: Lu, Yiyang, et al.
Published: (2026)
BatCoder: Self-Supervised Bidirectional Code-Documentation Learning via Back-Translation
by: Xu, Jingwen, et al.
Published: (2026)
by: Xu, Jingwen, et al.
Published: (2026)
Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction
by: Tian, Muzhao, et al.
Published: (2026)
by: Tian, Muzhao, et al.
Published: (2026)
Enhancing Model Privacy in Federated Learning with Random Masking and Quantization
by: Xu, Zhibo, et al.
Published: (2025)
by: Xu, Zhibo, et al.
Published: (2025)
Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges
by: Wang, Xiaohua, et al.
Published: (2026)
by: Wang, Xiaohua, et al.
Published: (2026)
Benchmark^2: Systematic Evaluation of LLM Benchmarks
by: Qian, Qi, et al.
Published: (2026)
by: Qian, Qi, et al.
Published: (2026)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
by: Li, Tianlong, et al.
Published: (2024)
by: Li, Tianlong, et al.
Published: (2024)
UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulation
by: Li, Tianlong, et al.
Published: (2023)
by: Li, Tianlong, et al.
Published: (2023)
RECAST: Expanding the Boundaries of LLMs' Complex Instruction Following with Multi-Constraint Data
by: Guo, Zhengkang, et al.
Published: (2025)
by: Guo, Zhengkang, et al.
Published: (2025)
Improving Continual Pre-training Through Seamless Data Packing
by: Yin, Ruicheng, et al.
Published: (2025)
by: Yin, Ruicheng, et al.
Published: (2025)
Aligning Large Language Models with Human Preferences through Representation Engineering
by: Liu, Wenhao, et al.
Published: (2023)
by: Liu, Wenhao, et al.
Published: (2023)
Enhancing the Capability and Robustness of Large Language Models through Reinforcement Learning-Driven Query Refinement
by: Wang, Xiaohua, et al.
Published: (2024)
by: Wang, Xiaohua, et al.
Published: (2024)
Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning
by: Wu, Muling, et al.
Published: (2025)
by: Wu, Muling, et al.
Published: (2025)
From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills
by: Huang, Zisu, et al.
Published: (2026)
by: Huang, Zisu, et al.
Published: (2026)
VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck
by: Zhang, Feiran, et al.
Published: (2026)
by: Zhang, Feiran, et al.
Published: (2026)
TripTailor: A Real-World Benchmark for Personalized Travel Planning
by: Shen, Yuanzhe, et al.
Published: (2025)
by: Shen, Yuanzhe, et al.
Published: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
by: Dou, Shihan, et al.
Published: (2025)
by: Dou, Shihan, et al.
Published: (2025)
Dendritic Localized Learning: Toward Biologically Plausible Algorithm
by: Lv, Changze, et al.
Published: (2025)
by: Lv, Changze, et al.
Published: (2025)
Biologically Plausible Learning via Bidirectional Spike-Based Distillation
by: Lv, Changze, et al.
Published: (2025)
by: Lv, Changze, et al.
Published: (2025)
Layer-Specific Scaling of Positional Encodings for Superior Long-Context Modeling
by: Wang, Zhenghua, et al.
Published: (2025)
by: Wang, Zhenghua, et al.
Published: (2025)
IntentionReasoner: Facilitating Adaptive LLM Safeguards through Intent Reasoning and Selective Query Refinement
by: Shen, Yuanzhe, et al.
Published: (2025)
by: Shen, Yuanzhe, et al.
Published: (2025)
Beyond Single Labels: Improving Conversational Recommendation through LLM-Powered Data Augmentation
by: Xu, Haozhe, et al.
Published: (2025)
by: Xu, Haozhe, et al.
Published: (2025)
Advancing Spiking Neural Networks for Sequential Modeling with Central Pattern Generators
by: Lv, Changze, et al.
Published: (2024)
by: Lv, Changze, et al.
Published: (2024)
Efficient and Effective Time-Series Forecasting with Spiking Neural Networks
by: Lv, Changze, et al.
Published: (2024)
by: Lv, Changze, et al.
Published: (2024)
SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading
by: Shen, Yuanzhe, et al.
Published: (2025)
by: Shen, Yuanzhe, et al.
Published: (2025)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
by: Liu, Boyang, et al.
Published: (2025)
by: Liu, Boyang, et al.
Published: (2025)
Rethinking Overlooked Aspects in Vision-Language Models
by: Liu, Yuan, et al.
Published: (2024)
by: Liu, Yuan, et al.
Published: (2024)
Domain Generalization via Causal Adjustment for Cross-Domain Sentiment Analysis
by: Wang, Siyin, et al.
Published: (2024)
by: Wang, Siyin, et al.
Published: (2024)
Toward Relative Positional Encoding in Spiking Transformers
by: Lv, Changze, et al.
Published: (2025)
by: Lv, Changze, et al.
Published: (2025)
Understanding DeepResearch via Reports
by: Fan, Tianyu, et al.
Published: (2025)
by: Fan, Tianyu, et al.
Published: (2025)
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
by: Li, Ruizhe, et al.
Published: (2026)
by: Li, Ruizhe, et al.
Published: (2026)
Explainable Synthetic Image Detection through Diffusion Timestep Ensembling
by: Wu, Yixin, et al.
Published: (2025)
by: Wu, Yixin, et al.
Published: (2025)
Advancing Parameter Efficiency in Fine-tuning via Representation Editing
by: Wu, Muling, et al.
Published: (2024)
by: Wu, Muling, et al.
Published: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
by: Lv, Huijie, et al.
Published: (2024)
by: Lv, Huijie, et al.
Published: (2024)
Deep Reinforcement Learning for Long-Short Portfolio Optimization
by: Huang, Gang, et al.
Published: (2020)
by: Huang, Gang, et al.
Published: (2020)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
by: Huang, Wenxuan, et al.
Published: (2026)
by: Huang, Wenxuan, et al.
Published: (2026)
Spiking Convolutional Neural Networks for Text Classification
by: Lv, Changze, et al.
Published: (2024)
by: Lv, Changze, et al.
Published: (2024)
LLM-Assisted Model-Based Fuzzing of Protocol Implementations
by: Huang, Changze, et al.
Published: (2025)
by: Huang, Changze, et al.
Published: (2025)
Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
by: Zhu, JianHao, et al.
Published: (2024)
by: Zhu, JianHao, et al.
Published: (2024)
Deep learning method for noise localization and quality control
by: Zhou, Jie
Published: (2025)
by: Zhou, Jie
Published: (2025)
Similar Items
-
CSSG: Measuring Code Similarity with Semantic Graphs
by: Lu, Yiyang, et al.
Published: (2026) -
BatCoder: Self-Supervised Bidirectional Code-Documentation Learning via Back-Translation
by: Xu, Jingwen, et al.
Published: (2026) -
Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction
by: Tian, Muzhao, et al.
Published: (2026) -
Enhancing Model Privacy in Federated Learning with Random Masking and Quantization
by: Xu, Zhibo, et al.
Published: (2025) -
Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges
by: Wang, Xiaohua, et al.
Published: (2026)