Evaluation Sheet for Deep Research: A Use Case for Academic Survey Writing
Fuente:
arXiv
Guardado en:
| Autores principales: | Azime, Israel Abebe, Belay, Tadesse Destaw, Tonja, Atnafu Lambebo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Walia-LLM: Enhancing Amharic-LLaMA by Integrating Task-Specific and Generative Datasets
por: Azime, Israel Abebe, et al.
Publicado: (2024)
por: Azime, Israel Abebe, et al.
Publicado: (2024)
Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages
por: Azime, Israel Abebe, et al.
Publicado: (2025)
por: Azime, Israel Abebe, et al.
Publicado: (2025)
A Case Against Implicit Standards: Homophone Normalization in Machine Translation for Languages that use the Ge'ez Script
por: Nigatu, Hellina Hailu, et al.
Publicado: (2025)
por: Nigatu, Hellina Hailu, et al.
Publicado: (2025)
EthioLLM: Multilingual Large Language Models for Ethiopian Languages with Task Evaluation
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
ProverbEval: Exploring LLM Evaluation Challenges for Low-resource Language Understanding
por: Azime, Israel Abebe, et al.
Publicado: (2024)
por: Azime, Israel Abebe, et al.
Publicado: (2024)
Evaluating the Capabilities of Large Language Models for Multi-label Emotion Understanding
por: Belay, Tadesse Destaw, et al.
Publicado: (2024)
por: Belay, Tadesse Destaw, et al.
Publicado: (2024)
EthioMT: Parallel Corpus for Low-resource Ethiopian Languages
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
The Zeno's Paradox of `Low-Resource' Languages
por: Nigatu, Hellina Hailu, et al.
Publicado: (2024)
por: Nigatu, Hellina Hailu, et al.
Publicado: (2024)
AfroXLMR-Social: Adapting Pre-trained Language Models for African Languages Social Media Text
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
AFRILANGTUTOR: Advancing Language Tutoring and Culture Education in Low-Resource Languages with Large Language Models
por: Belay, Tadesse Destaw, et al.
Publicado: (2026)
por: Belay, Tadesse Destaw, et al.
Publicado: (2026)
AfrIFact: Cultural Information Retrieval, Evidence Extraction and Fact Checking for African Languages
por: Azime, Israel Abebe, et al.
Publicado: (2026)
por: Azime, Israel Abebe, et al.
Publicado: (2026)
NLP Progress in Indigenous Latin American Languages
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
Bilingual Word Level Language Identification for Omotic Languages
por: Yigezu, Mesay Gemeda, et al.
Publicado: (2025)
por: Yigezu, Mesay Gemeda, et al.
Publicado: (2025)
Explainable AI: XAI-Guided Context-Aware Data Augmentation
por: Mersha, Melkamu Abay, et al.
Publicado: (2025)
por: Mersha, Melkamu Abay, et al.
Publicado: (2025)
Ethio-ASR: Joint Multilingual Speech Recognition and Language Identification for Ethiopian Languages
por: Abdullah, Badr M., et al.
Publicado: (2026)
por: Abdullah, Badr M., et al.
Publicado: (2026)
InkubaLM: A small language model for low-resource African languages
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
Afri-MCQA: Multimodal Cultural Question Answering for African Languages
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2026)
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2026)
Accept or Deny? Evaluating LLM Fairness and Performance in Loan Approval across Table-to-Text Serialization Approaches
por: Azime, Israel Abebe, et al.
Publicado: (2025)
por: Azime, Israel Abebe, et al.
Publicado: (2025)
CULEMO: Cultural Lenses on Emotion -- Benchmarking LLMs for Cross-Cultural Emotion Understanding
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
Exploring Cultural Nuances in Emotion Perception Across 15 African Languages
por: Ahmad, Ibrahim Said, et al.
Publicado: (2025)
por: Ahmad, Ibrahim Said, et al.
Publicado: (2025)
Enhancing Multi-Label Emotion Analysis and Corresponding Intensities for Ethiopian Languages
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation
por: Xu, Tianyi, et al.
Publicado: (2026)
por: Xu, Tianyi, et al.
Publicado: (2026)
AmharicStoryQA: A Multicultural Story Question Answering Benchmark in Amharic
por: Azime, Israel Abebe, et al.
Publicado: (2026)
por: Azime, Israel Abebe, et al.
Publicado: (2026)
Whispering in Amharic: Fine-tuning Whisper for Low-resource Language
por: Gete, Dawit Ketema, et al.
Publicado: (2025)
por: Gete, Dawit Ketema, et al.
Publicado: (2025)
DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing
por: Zhang, Hongzhi, et al.
Publicado: (2026)
por: Zhang, Hongzhi, et al.
Publicado: (2026)
The Esethu Framework: Reimagining Sustainable Dataset Governance and Curation for Low-Resource Languages
por: Rajab, Jenalea, et al.
Publicado: (2025)
por: Rajab, Jenalea, et al.
Publicado: (2025)
Beyond Majority Voting: Agreement-Based Clustering to Model Annotator Perspectives in Subjective NLP Tasks
por: Belay, Tadesse Destaw, et al.
Publicado: (2026)
por: Belay, Tadesse Destaw, et al.
Publicado: (2026)
The Rise of AfricaNLP: A Survey of Contributions, Contributors, Community Impact, and Bibliometric Analysis
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
por: Li, Minghao, et al.
Publicado: (2025)
por: Li, Minghao, et al.
Publicado: (2025)
SurveyBench: Can LLM(-Agents) Write Academic Surveys that Align with Reader Needs?
por: Sun, Zhaojun, et al.
Publicado: (2025)
por: Sun, Zhaojun, et al.
Publicado: (2025)
Automatic Speech Recognition (ASR) for African Low-Resource Languages: A Systematic Literature Review
por: Imam, Sukairaj Hafiz, et al.
Publicado: (2025)
por: Imam, Sukairaj Hafiz, et al.
Publicado: (2025)
DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Survey
por: Zhang, Guo-Biao, et al.
Publicado: (2026)
por: Zhang, Guo-Biao, et al.
Publicado: (2026)
Meow: End-to-End Outline Writing for Automatic Academic Survey
por: Ma, Zhaoyu, et al.
Publicado: (2025)
por: Ma, Zhaoyu, et al.
Publicado: (2025)
Uhura: A Benchmark for Evaluating Scientific Question Answering and Truthfulness in Low-Resource African Languages
por: Bayes, Edward, et al.
Publicado: (2024)
por: Bayes, Edward, et al.
Publicado: (2024)
CaMMT: Benchmarking Culturally Aware Multimodal Machine Translation
por: Villa-Cueva, Emilio, et al.
Publicado: (2025)
por: Villa-Cueva, Emilio, et al.
Publicado: (2025)
Let's Use ChatGPT To Write Our Paper! Benchmarking LLMs To Write the Introduction of a Research Paper
por: Garg, Krishna, et al.
Publicado: (2025)
por: Garg, Krishna, et al.
Publicado: (2025)
Measuring Human Involvement in AI-Generated Text: A Case Study on Academic Writing
por: Guo, Yuchen, et al.
Publicado: (2025)
por: Guo, Yuchen, et al.
Publicado: (2025)
Exposía: Teaching and Assessment of Academic Writing Skills for Research Project Proposals and Peer Feedback
por: Zyska, Dennis, et al.
Publicado: (2026)
por: Zyska, Dennis, et al.
Publicado: (2026)
SurveyForge: On the Outline Heuristics, Memory-Driven Generation, and Multi-dimensional Evaluation for Automated Survey Writing
por: Yan, Xiangchao, et al.
Publicado: (2025)
por: Yan, Xiangchao, et al.
Publicado: (2025)
Deep Research, Shallow Evaluation: A Case Study in Meta-Evaluation for Long-Form QA Benchmarks
por: Hwang, Jena D., et al.
Publicado: (2026)
por: Hwang, Jena D., et al.
Publicado: (2026)
Ejemplares similares
-
Walia-LLM: Enhancing Amharic-LLaMA by Integrating Task-Specific and Generative Datasets
por: Azime, Israel Abebe, et al.
Publicado: (2024) -
Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages
por: Azime, Israel Abebe, et al.
Publicado: (2025) -
A Case Against Implicit Standards: Homophone Normalization in Machine Translation for Languages that use the Ge'ez Script
por: Nigatu, Hellina Hailu, et al.
Publicado: (2025) -
EthioLLM: Multilingual Large Language Models for Ethiopian Languages with Task Evaluation
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024) -
ProverbEval: Exploring LLM Evaluation Challenges for Low-resource Language Understanding
por: Azime, Israel Abebe, et al.
Publicado: (2024)