DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Survey
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Guo-Biao, Liu, Ding-Yuan, Wu, Da-Yi, Lan, Tian, Huang, Heyan, Wu, Zhijing, Mao, Xian-Ling |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations
por: Lan, Tian, et al.
Publicado: (2025)
por: Lan, Tian, et al.
Publicado: (2025)
Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark
por: Tu, Rong-Cheng, et al.
Publicado: (2024)
por: Tu, Rong-Cheng, et al.
Publicado: (2024)
Training-free Truthfulness Detection via Value Vectors in LLMs
por: Liu, Runheng, et al.
Publicado: (2025)
por: Liu, Runheng, et al.
Publicado: (2025)
Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines
por: Ma, Zi-Ao, et al.
Publicado: (2024)
por: Ma, Zi-Ao, et al.
Publicado: (2024)
T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation
por: Ma, Zi-Ao, et al.
Publicado: (2025)
por: Ma, Zi-Ao, et al.
Publicado: (2025)
A Distributed Collaborative Retrieval Framework Excelling in All Queries and Corpora based on Zero-shot Rank-Oriented Automatic Evaluation
por: Che, Tian-Yi, et al.
Publicado: (2024)
por: Che, Tian-Yi, et al.
Publicado: (2024)
EXCEEDS: Extracting Complex Events via Nugget-based Grid Modeling in Scientific Domain
por: Lu, Yi-Fan, et al.
Publicado: (2024)
por: Lu, Yi-Fan, et al.
Publicado: (2024)
SEOE: A Scalable and Reliable Semantic Evaluation Framework for Open Domain Event Detection
por: Lu, Yi-Fan, et al.
Publicado: (2025)
por: Lu, Yi-Fan, et al.
Publicado: (2025)
Zero-Shot Detection of LLM-Generated Text via Implicit Reward Model
por: Liu, Runheng, et al.
Publicado: (2026)
por: Liu, Runheng, et al.
Publicado: (2026)
Beyond Exact Match: Semantically Reassessing Event Extraction by Large Language Models
por: Lu, Yi-Fan, et al.
Publicado: (2024)
por: Lu, Yi-Fan, et al.
Publicado: (2024)
Mix-Initiative Response Generation with Dynamic Prefix Tuning
por: Nie, Yuxiang, et al.
Publicado: (2024)
por: Nie, Yuxiang, et al.
Publicado: (2024)
I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications
por: Dai, Dasen, et al.
Publicado: (2026)
por: Dai, Dasen, et al.
Publicado: (2026)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
por: Li, Minghao, et al.
Publicado: (2025)
por: Li, Minghao, et al.
Publicado: (2025)
CriticEval: Evaluating Large Language Model as Critic
por: Lan, Tian, et al.
Publicado: (2024)
por: Lan, Tian, et al.
Publicado: (2024)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
Subtopic-aware View Sampling and Temporal Aggregation for Long-form Document Matching
por: Zhou, Youchao, et al.
Publicado: (2024)
por: Zhou, Youchao, et al.
Publicado: (2024)
FlashBack:Efficient Retrieval-Augmented Language Modeling for Long Context Inference
por: Liu, Runheng, et al.
Publicado: (2024)
por: Liu, Runheng, et al.
Publicado: (2024)
ISExplore:Informative Segment Selection for Efficient Personalized 3D Talking Face Generation
por: Sun, Rui-Qing, et al.
Publicado: (2025)
por: Sun, Rui-Qing, et al.
Publicado: (2025)
SurveyBench: Can LLM(-Agents) Write Academic Surveys that Align with Reader Needs?
por: Sun, Zhaojun, et al.
Publicado: (2025)
por: Sun, Zhaojun, et al.
Publicado: (2025)
A Survey of Automatic Hallucination Evaluation on Natural Language Generation
por: Qi, Siya, et al.
Publicado: (2024)
por: Qi, Siya, et al.
Publicado: (2024)
SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation
por: Su, Weihang, et al.
Publicado: (2025)
por: Su, Weihang, et al.
Publicado: (2025)
Meow: End-to-End Outline Writing for Automatic Academic Survey
por: Ma, Zhaoyu, et al.
Publicado: (2025)
por: Ma, Zhaoyu, et al.
Publicado: (2025)
MMWOZ: Building Multimodal Agent for Task-oriented Dialogue
por: Yang, Pu-Hai, et al.
Publicado: (2025)
por: Yang, Pu-Hai, et al.
Publicado: (2025)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
por: Li, Haitian, et al.
Publicado: (2026)
por: Li, Haitian, et al.
Publicado: (2026)
SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys
por: Zhao, Jiahao, et al.
Publicado: (2025)
por: Zhao, Jiahao, et al.
Publicado: (2025)
Training Language Models to Critique With Multi-agent Feedback
por: Lan, Tian, et al.
Publicado: (2024)
por: Lan, Tian, et al.
Publicado: (2024)
SurveyLens: A Research Discipline-Aware Benchmark for Automatic Survey Generation
por: Guo, Beichen, et al.
Publicado: (2026)
por: Guo, Beichen, et al.
Publicado: (2026)
CoFiNet: Unveiling Camouflaged Objects with Multi-Scale Finesse
por: Guo, Cunhan, et al.
Publicado: (2024)
por: Guo, Cunhan, et al.
Publicado: (2024)
Foundations and Recent Trends in Multimodal Mobile Agents: A Survey
por: Wu, Biao, et al.
Publicado: (2024)
por: Wu, Biao, et al.
Publicado: (2024)
AutoSurvey: Large Language Models Can Automatically Write Surveys
por: Wang, Yidong, et al.
Publicado: (2024)
por: Wang, Yidong, et al.
Publicado: (2024)
A Survey of RWKV
por: Li, Zhiyuan, et al.
Publicado: (2024)
por: Li, Zhiyuan, et al.
Publicado: (2024)
Efficient and Robust Video Defense Framework against 3D-field Personalized Talking Face
por: Sun, Rui-qing, et al.
Publicado: (2025)
por: Sun, Rui-qing, et al.
Publicado: (2025)
Deep Literature Survey Automation with an Iterative Workflow
por: Zhang, Hongbo, et al.
Publicado: (2025)
por: Zhang, Hongbo, et al.
Publicado: (2025)
Coverage Evaluation of the Academic Library Survey.
por: Marston, Christopher C.
Publicado: (1999)
por: Marston, Christopher C.
Publicado: (1999)
A Survey on Data Augmentation in Large Model Era
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
A Survey of Retentive Network
por: Yang, Haiqi, et al.
Publicado: (2025)
por: Yang, Haiqi, et al.
Publicado: (2025)
Instruct Large Language Models to Generate Scientific Literature Survey Step by Step
por: Lai, Yuxuan, et al.
Publicado: (2024)
por: Lai, Yuxuan, et al.
Publicado: (2024)
Searching Scientific Information on the Internet: A Dutch Academic User Survey.
por: Voorbij, Henk J.
Publicado: (1999)
por: Voorbij, Henk J.
Publicado: (1999)
Deep Generative Models for Offline Policy Learning: Tutorial, Survey, and Perspectives on Future Directions
por: Chen, Jiayu, et al.
Publicado: (2024)
por: Chen, Jiayu, et al.
Publicado: (2024)
Online Sequential Decision-Making with Unknown Delays
por: Wu, Ping, et al.
Publicado: (2024)
por: Wu, Ping, et al.
Publicado: (2024)
Ejemplares similares
-
A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations
por: Lan, Tian, et al.
Publicado: (2025) -
Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark
por: Tu, Rong-Cheng, et al.
Publicado: (2024) -
Training-free Truthfulness Detection via Value Vectors in LLMs
por: Liu, Runheng, et al.
Publicado: (2025) -
Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines
por: Ma, Zi-Ao, et al.
Publicado: (2024) -
T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation
por: Ma, Zi-Ao, et al.
Publicado: (2025)