Enregistré dans:
| Auteurs principaux: | Shi, Zhengliang, Chen, Yiqun, Li, Haitao, Sun, Weiwei, Ni, Shiyu, Lyu, Yougang, Fan, Run-Ze, Jin, Bowen, Weng, Yixuan, Zhu, Minjun, Xie, Qiujie, Guo, Xinyu, Yang, Qu, Wu, Jiayi, Zhao, Jujia, Tang, Xiaqiang, Ma, Xinbei, Wang, Cunxiang, Mao, Jiaxin, Ai, Qingyao, Huang, Jen-Tse, Wang, Wenxuan, Zhang, Yue, Yang, Yiming, Tu, Zhaopeng, Ren, Zhaochun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.02038 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AI Scientists Fail Without Strong Implementation Capability
par: Zhu, Minjun, et autres
Publié: (2025)
par: Zhu, Minjun, et autres
Publié: (2025)
Social Welfare Function Leaderboard: When LLM Agents Allocate Social Welfare
par: Shi, Zhengliang, et autres
Publié: (2025)
par: Shi, Zhengliang, et autres
Publié: (2025)
DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively
par: Weng, Yixuan, et autres
Publié: (2025)
par: Weng, Yixuan, et autres
Publié: (2025)
Enhancing LLM-Based Agents via Global Planning and Hierarchical Execution
par: Chen, Junjie, et autres
Publié: (2025)
par: Chen, Junjie, et autres
Publié: (2025)
Personality Alignment of Large Language Models
par: Zhu, Minjun, et autres
Publié: (2024)
par: Zhu, Minjun, et autres
Publié: (2024)
DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process
par: Zhu, Minjun, et autres
Publié: (2025)
par: Zhu, Minjun, et autres
Publié: (2025)
Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question Answering
par: Shi, Zhengliang, et autres
Publié: (2024)
par: Shi, Zhengliang, et autres
Publié: (2024)
Cognitive Biases in Large Language Models for News Recommendation
par: Lyu, Yougang, et autres
Publié: (2024)
par: Lyu, Yougang, et autres
Publié: (2024)
AutoFigure: Generating and Refining Publication-Ready Scientific Illustrations
par: Zhu, Minjun, et autres
Publié: (2026)
par: Zhu, Minjun, et autres
Publié: (2026)
Overview of the NTCIR-18 Automatic Evaluation of LLMs (AEOLLM) Task
par: Chen, Junjie, et autres
Publié: (2025)
par: Chen, Junjie, et autres
Publié: (2025)
ATACompressor: Adaptive Task-Aware Compression for Efficient Long-Context Processing in LLMs
par: Li, Xuancheng, et autres
Publié: (2026)
par: Li, Xuancheng, et autres
Publié: (2026)
MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop
par: Li, Xuancheng, et autres
Publié: (2026)
par: Li, Xuancheng, et autres
Publié: (2026)
PRE: A Peer Review Based Large Language Model Evaluator
par: Chu, Zhumin, et autres
Publié: (2024)
par: Chu, Zhumin, et autres
Publié: (2024)
Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs
par: Li, Xuancheng, et autres
Publié: (2026)
par: Li, Xuancheng, et autres
Publié: (2026)
The Hunger Game Debate: On the Emergence of Over-Competition in Multi-Agent Systems
par: Ma, Xinbei, et autres
Publié: (2025)
par: Ma, Xinbei, et autres
Publié: (2025)
Unifying Search and Recommendation in LLMs via Gradient Multi-Subspace Tuning
par: Zhao, Jujia, et autres
Publié: (2026)
par: Zhao, Jujia, et autres
Publié: (2026)
How Far Are AI Scientists from Changing the World?
par: Xie, Qiujie, et autres
Publié: (2025)
par: Xie, Qiujie, et autres
Publié: (2025)
DeepReviewer 2.0: A Traceable Agentic System for Auditable Scientific Peer Review
par: Weng, Yixuan, et autres
Publié: (2026)
par: Weng, Yixuan, et autres
Publié: (2026)
Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs
par: Huang, Jen-Tse, et autres
Publié: (2025)
par: Huang, Jen-Tse, et autres
Publié: (2025)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
par: Hu, Ziyou, et autres
Publié: (2025)
par: Hu, Ziyou, et autres
Publié: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
Unifying Search and Recommendation with Dual-View Representation Learning in a Generative Paradigm
par: Zhao, Jujia, et autres
Publié: (2025)
par: Zhao, Jujia, et autres
Publié: (2025)
Foundations of GenIR
par: Ai, Qingyao, et autres
Publié: (2025)
par: Ai, Qingyao, et autres
Publié: (2025)
On the Shortcut Learning in Multilingual Neural Machine Translation
par: Wang, Wenxuan, et autres
Publié: (2024)
par: Wang, Wenxuan, et autres
Publié: (2024)
Cold-Starts in Generative Recommendation: A Reproducibility Study
par: Zhang, Zhen, et autres
Publié: (2026)
par: Zhang, Zhen, et autres
Publié: (2026)
CycleResearcher: Improving Automated Research via Automated Review
par: Weng, Yixuan, et autres
Publié: (2024)
par: Weng, Yixuan, et autres
Publié: (2024)
Beyond Exposure: Optimizing Ranking Fairness with Non-linear Time-Income Functions
par: Li, Xuancheng, et autres
Publié: (2026)
par: Li, Xuancheng, et autres
Publié: (2026)
A Cooperative Multi-Agent Framework for Zero-Shot Named Entity Recognition
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
DeepShop: A Benchmark for Deep Research Shopping Agents
par: Lyu, Yougang, et autres
Publié: (2025)
par: Lyu, Yougang, et autres
Publié: (2025)
Optimization of High‐Definition Music Streaming VANET Broadcast Protocol for QoS
par: Xinbei Shi
Publié: (2025)
par: Xinbei Shi
Publié: (2025)
VN Network: Embedding Newly Emerging Entities with Virtual Neighbors
par: He, Yongquan, et autres
Publié: (2024)
par: He, Yongquan, et autres
Publié: (2024)
Towards an In-Depth Comprehension of Case Relevance for Better Legal Retrieval
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
Evaluation Ethics of LLMs in Legal Domain
par: Zhang, Ruizhe, et autres
Publié: (2024)
par: Zhang, Ruizhe, et autres
Publié: (2024)
CalibraEval: Calibrating Prediction Distribution to Mitigate Selection Bias in LLMs-as-Judges
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
MAIR: A Massive Benchmark for Evaluating Instructed Retrieval
par: Sun, Weiwei, et autres
Publié: (2024)
par: Sun, Weiwei, et autres
Publié: (2024)
ReportLogic: Evaluating Logical Quality in Deep Research Reports
par: Zhao, Jujia, et autres
Publié: (2026)
par: Zhao, Jujia, et autres
Publié: (2026)
ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents
par: Yang, Linyi, et autres
Publié: (2025)
par: Yang, Linyi, et autres
Publié: (2025)
LexRAG: Benchmarking Retrieval-Augmented Generation in Multi-Turn Legal Consultation Conversation
par: Li, Haitao, et autres
Publié: (2025)
par: Li, Haitao, et autres
Publié: (2025)
Scaling Laws For Dense Retrieval
par: Fang, Yan, et autres
Publié: (2024)
par: Fang, Yan, et autres
Publié: (2024)
Abduct, Act, Predict: Scaffolding Causal Inference for Automated Failure Attribution in Multi-Agent Systems
par: West, Alva, et autres
Publié: (2025)
par: West, Alva, et autres
Publié: (2025)
Documents similaires
-
AI Scientists Fail Without Strong Implementation Capability
par: Zhu, Minjun, et autres
Publié: (2025) -
Social Welfare Function Leaderboard: When LLM Agents Allocate Social Welfare
par: Shi, Zhengliang, et autres
Publié: (2025) -
DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively
par: Weng, Yixuan, et autres
Publié: (2025) -
Enhancing LLM-Based Agents via Global Planning and Hierarchical Execution
par: Chen, Junjie, et autres
Publié: (2025) -
Personality Alignment of Large Language Models
par: Zhu, Minjun, et autres
Publié: (2024)