TaskComplexity: A Dataset for Task Complexity Classification with In-Context Learning, FLAN-T5 and GPT-4o Benchmarks
Fuente:
arXiv
Saved in:
| Main Authors: | Rasheed, Areeg Fahad, Zarkoosh, M., Abbas, Safa F., Al-Azzawi, Sana Sabah |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mashee at SemEval-2024 Task 8: The Impact of Samples Quality on the Performance of In-Context Learning for Machine Text Classification
by: Rasheed, Areeg Fahad, et al.
Published: (2024)
by: Rasheed, Areeg Fahad, et al.
Published: (2024)
Data Augmentation to Improve Large Language Models in Food Hazard and Product Detection
by: Rasheed, Areeg Fahad, et al.
Published: (2025)
by: Rasheed, Areeg Fahad, et al.
Published: (2025)
YOLOv11 Optimization for Efficient Resource Utilization
by: Rasheed, Areeg Fahad, et al.
Published: (2024)
by: Rasheed, Areeg Fahad, et al.
Published: (2024)
Lon-ea at SemEval-2023 Task 11: A Comparison of Activation Functions for Soft and Hard Label Prediction
by: Hosseini, Peyman, et al.
Published: (2023)
by: Hosseini, Peyman, et al.
Published: (2023)
Czech Dataset for Complex Aspect-Based Sentiment Analysis Tasks
by: Šmíd, Jakub, et al.
Published: (2025)
by: Šmíd, Jakub, et al.
Published: (2025)
LegalRikai: Open Benchmark -- Benchmark for Complex Japanese Corporate Legal Tasks
by: Fujita, Shogo, et al.
Published: (2025)
by: Fujita, Shogo, et al.
Published: (2025)
Benchmarking Information Retrieval Models on Complex Retrieval Tasks
by: Killingback, Julian, et al.
Published: (2025)
by: Killingback, Julian, et al.
Published: (2025)
MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks
by: Zhang, Lei, et al.
Published: (2025)
by: Zhang, Lei, et al.
Published: (2025)
TOD-ProcBench: Benchmarking Complex Instruction-Following in Task-Oriented Dialogues
by: Ghazarian, Sarik, et al.
Published: (2025)
by: Ghazarian, Sarik, et al.
Published: (2025)
Characterizing Knowledge Graph Tasks in LLM Benchmarks Using Cognitive Complexity Frameworks
by: Todorovikj, Sara, et al.
Published: (2025)
by: Todorovikj, Sara, et al.
Published: (2025)
ComplexityNet: Increasing LLM Inference Efficiency by Learning Task Complexity
by: Bae, Henry, et al.
Published: (2023)
by: Bae, Henry, et al.
Published: (2023)
BenTo: Benchmark Task Reduction with In-Context Transferability
by: Zhao, Hongyu, et al.
Published: (2024)
by: Zhao, Hongyu, et al.
Published: (2024)
BIRCO: A Benchmark of Information Retrieval Tasks with Complex Objectives
by: Wang, Xiaoyue, et al.
Published: (2024)
by: Wang, Xiaoyue, et al.
Published: (2024)
Leveraging Distillation Techniques for Document Understanding: A Case Study with FLAN-T5
by: Lamott, Marcel, et al.
Published: (2024)
by: Lamott, Marcel, et al.
Published: (2024)
Medalyze: Lightweight Medical Report Summarization Application Using FLAN-T5-Large
by: Nguyen, Van-Tinh, et al.
Published: (2025)
by: Nguyen, Van-Tinh, et al.
Published: (2025)
Audio-FLAN: A Preliminary Release
by: Xue, Liumeng, et al.
Published: (2025)
by: Xue, Liumeng, et al.
Published: (2025)
Complexity of Symbolic Representation in Working Memory of Transformer Correlates with the Complexity of a Task
by: Sagirova, Alsu, et al.
Published: (2024)
by: Sagirova, Alsu, et al.
Published: (2024)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
by: Jubair, Sheikh, et al.
Published: (2025)
by: Jubair, Sheikh, et al.
Published: (2025)
Schema-Aware Multi-Task Learning for Complex Text-to-SQL
by: Wu, Yangjun, et al.
Published: (2024)
by: Wu, Yangjun, et al.
Published: (2024)
Task-Oriented Dialogue with In-Context Learning
by: Bocklisch, Tom, et al.
Published: (2024)
by: Bocklisch, Tom, et al.
Published: (2024)
A Fine-Tuning Approach for T5 Using Knowledge Graphs to Address Complex Tasks
by: Liao, Xiaoxuan, et al.
Published: (2025)
by: Liao, Xiaoxuan, et al.
Published: (2025)
Localizing Task Recognition and Task Learning in In-Context Learning via Attention Head Analysis
by: Yang, Haolin, et al.
Published: (2025)
by: Yang, Haolin, et al.
Published: (2025)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
by: Song, Yuanyi, et al.
Published: (2025)
by: Song, Yuanyi, et al.
Published: (2025)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
by: Long, Xiang, et al.
Published: (2026)
by: Long, Xiang, et al.
Published: (2026)
LLM for Complex Reasoning Task: An Exploratory Study in Fermi Problems
by: Liu, Zishuo, et al.
Published: (2025)
by: Liu, Zishuo, et al.
Published: (2025)
A Survey on Complex Tasks for Goal-Directed Interactive Agents
by: Hartmann, Mareike, et al.
Published: (2024)
by: Hartmann, Mareike, et al.
Published: (2024)
Benchmarking the Performance of Pre-trained LLMs across Urdu NLP Tasks
by: Tahir, Munief Hassan, et al.
Published: (2024)
by: Tahir, Munief Hassan, et al.
Published: (2024)
MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
by: Wang, Zhenting, et al.
Published: (2025)
by: Wang, Zhenting, et al.
Published: (2025)
Language and Experience: A Computational Model of Social Learning in Complex Tasks
by: Colas, Cédric, et al.
Published: (2025)
by: Colas, Cédric, et al.
Published: (2025)
Consolidating and Developing Benchmarking Datasets for the Nepali Natural Language Understanding Tasks
by: Nyachhyon, Jinu, et al.
Published: (2024)
by: Nyachhyon, Jinu, et al.
Published: (2024)
Learning Task Representations from In-Context Learning
by: Saglam, Baturay, et al.
Published: (2025)
by: Saglam, Baturay, et al.
Published: (2025)
Investigating the Pre-Training Dynamics of In-Context Learning: Task Recognition vs. Task Learning
by: Wang, Xiaolei, et al.
Published: (2024)
by: Wang, Xiaolei, et al.
Published: (2024)
Sentiment and Emotion Classification of Indonesian E-Commerce Reviews via Multi-Task BiLSTM and AutoML Benchmarking
by: Manurung, Hermawan, et al.
Published: (2026)
by: Manurung, Hermawan, et al.
Published: (2026)
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
by: Hsu, Ming-Hao, et al.
Published: (2023)
by: Hsu, Ming-Hao, et al.
Published: (2023)
A Comparison of Human and ChatGPT Classification Performance on Complex Social Media Data
by: Green, Breanna E., et al.
Published: (2025)
by: Green, Breanna E., et al.
Published: (2025)
Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models
by: Chen, Zehui, et al.
Published: (2024)
by: Chen, Zehui, et al.
Published: (2024)
Does Task Complexity Moderate the Benefits of Liveness? A Controlled Experiment
by: Rein, Patrick, et al.
Published: (2024)
by: Rein, Patrick, et al.
Published: (2024)
BAR: A Backward Reasoning based Agent for Complex Minecraft Tasks
by: Du, Weihong, et al.
Published: (2025)
by: Du, Weihong, et al.
Published: (2025)
Divide et Impera: Multi-Transformer Architectures for Complex NLP-Tasks
by: Helland, Solveig, et al.
Published: (2023)
by: Helland, Solveig, et al.
Published: (2023)
Reasoning Topology Matters: Network-of-Thought for Complex Reasoning Tasks
by: Huang, Fan
Published: (2026)
by: Huang, Fan
Published: (2026)
Similar Items
-
Mashee at SemEval-2024 Task 8: The Impact of Samples Quality on the Performance of In-Context Learning for Machine Text Classification
by: Rasheed, Areeg Fahad, et al.
Published: (2024) -
Data Augmentation to Improve Large Language Models in Food Hazard and Product Detection
by: Rasheed, Areeg Fahad, et al.
Published: (2025) -
YOLOv11 Optimization for Efficient Resource Utilization
by: Rasheed, Areeg Fahad, et al.
Published: (2024) -
Lon-ea at SemEval-2023 Task 11: A Comparison of Activation Functions for Soft and Hard Label Prediction
by: Hosseini, Peyman, et al.
Published: (2023) -
Czech Dataset for Complex Aspect-Based Sentiment Analysis Tasks
by: Šmíd, Jakub, et al.
Published: (2025)