PARADISE: Evaluating Implicit Planning Skills of Language Models with Procedural Warnings and Tips Dataset
Fuente:
arXiv
Guardado en:
| Autores principales: | Uzunoglu, Arda, Safa, Abdalfatah Rashid, Şahin, Gözde Gül |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Benchmarking Procedural Language Understanding for Low-Resource Languages: A Case Study on Turkish
por: Uzunoglu, Arda, et al.
Publicado: (2023)
por: Uzunoglu, Arda, et al.
Publicado: (2023)
Instructional Text Across Disciplines: A Survey of Representations, Downstream Tasks, and Open Challenges Toward Capable AI Agents
por: Safa, Abdulfattah, et al.
Publicado: (2024)
por: Safa, Abdulfattah, et al.
Publicado: (2024)
A Zero-Shot Open-Vocabulary Pipeline for Dialogue Understanding
por: Safa, Abdulfattah, et al.
Publicado: (2024)
por: Safa, Abdulfattah, et al.
Publicado: (2024)
Linguistically-Informed Multilingual Instruction Tuning: Is There an Optimal Set of Languages to Tune?
por: Soykan, Gürkan, et al.
Publicado: (2024)
por: Soykan, Gürkan, et al.
Publicado: (2024)
GECTurk WEB: An Explainable Online Platform for Turkish Grammatical Error Detection and Correction
por: Gebeşçe, Ali, et al.
Publicado: (2024)
por: Gebeşçe, Ali, et al.
Publicado: (2024)
Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
por: Uzunoglu, Arda, et al.
Publicado: (2026)
por: Uzunoglu, Arda, et al.
Publicado: (2026)
The Flaw of Averages: Quantifying Uniformity of Performance on Benchmarks
por: Uzunoglu, Arda, et al.
Publicado: (2025)
por: Uzunoglu, Arda, et al.
Publicado: (2025)
Are Non-English Papers Reviewed Fairly? Language-of-Study Bias in NLP Peer Reviews
por: Barkhordar, Ehsan, et al.
Publicado: (2026)
por: Barkhordar, Ehsan, et al.
Publicado: (2026)
Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
por: Er, Yakup Abrek, et al.
Publicado: (2025)
por: Er, Yakup Abrek, et al.
Publicado: (2025)
WorldAPIs: The World Is Worth How Many APIs? A Thought Experiment
por: Ou, Jiefu, et al.
Publicado: (2024)
por: Ou, Jiefu, et al.
Publicado: (2024)
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
por: Li, Zhuoqun, et al.
Publicado: (2024)
por: Li, Zhuoqun, et al.
Publicado: (2024)
ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household Activities
por: Su, Ying, et al.
Publicado: (2024)
por: Su, Ying, et al.
Publicado: (2024)
CHANCERY: Evaluating Corporate Governance Reasoning Capabilities in Language Models
por: Irwin, Lucas, et al.
Publicado: (2025)
por: Irwin, Lucas, et al.
Publicado: (2025)
LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning
por: Sun, Shibo, et al.
Publicado: (2025)
por: Sun, Shibo, et al.
Publicado: (2025)
Procedural Dilemma Generation for Evaluating Moral Reasoning in Humans and Language Models
por: Fränken, Jan-Philipp, et al.
Publicado: (2024)
por: Fränken, Jan-Philipp, et al.
Publicado: (2024)
Predicting Implicit Arguments in Procedural Video Instructions
por: Batra, Anil, et al.
Publicado: (2025)
por: Batra, Anil, et al.
Publicado: (2025)
ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans
por: Sadana, Ananya, et al.
Publicado: (2025)
por: Sadana, Ananya, et al.
Publicado: (2025)
Uncovering Implicit Bias in Large Language Models with Concept Learning Dataset
por: Wang, Leroy Z.
Publicado: (2025)
por: Wang, Leroy Z.
Publicado: (2025)
OffensiveLang: A Community Based Implicit Offensive Language Dataset
por: Das, Amit, et al.
Publicado: (2024)
por: Das, Amit, et al.
Publicado: (2024)
iCLP: Large Language Model Reasoning with Implicit Cognition Latent Planning
por: Chen, Sijia, et al.
Publicado: (2025)
por: Chen, Sijia, et al.
Publicado: (2025)
Can Large Language Models Identify Implicit Suicidal Ideation? An Empirical Evaluation
por: Li, Tong, et al.
Publicado: (2025)
por: Li, Tong, et al.
Publicado: (2025)
SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures
por: Wang, Jiaming, et al.
Publicado: (2025)
por: Wang, Jiaming, et al.
Publicado: (2025)
L0-Reasoning Bench: Evaluating Procedural Correctness in Language Models via Simple Program Execution
por: Sun, Simeng, et al.
Publicado: (2025)
por: Sun, Simeng, et al.
Publicado: (2025)
What's the Plan? Evaluating and Developing Planning-Aware Techniques for Language Models
por: Hirsch, Eran, et al.
Publicado: (2024)
por: Hirsch, Eran, et al.
Publicado: (2024)
Implicit Representations of Grammaticality in Language Models
por: Wang, Yingshan Susan, et al.
Publicado: (2026)
por: Wang, Yingshan Susan, et al.
Publicado: (2026)
What Triggers my Model? Contrastive Explanations Inform Gender Choices by Translation Models
por: Hackenbuchner, Janiça, et al.
Publicado: (2025)
por: Hackenbuchner, Janiça, et al.
Publicado: (2025)
Evaluation of the Programming Skills of Large Language Models
por: Heitz, Luc Bryan, et al.
Publicado: (2024)
por: Heitz, Luc Bryan, et al.
Publicado: (2024)
Evaluating Vision-Language Models as Evaluators in Path Planning
por: Aghzal, Mohamed, et al.
Publicado: (2024)
por: Aghzal, Mohamed, et al.
Publicado: (2024)
Advancing High Resolution Vision-Language Models in Biomedicine
por: Chen, Zekai, et al.
Publicado: (2024)
por: Chen, Zekai, et al.
Publicado: (2024)
SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos
por: Huang, Xiyang, et al.
Publicado: (2026)
por: Huang, Xiyang, et al.
Publicado: (2026)
If there's a Trigger Warning, then where's the Trigger? Investigating Trigger Warnings at the Passage Level
por: Wiegmann, Matti, et al.
Publicado: (2024)
por: Wiegmann, Matti, et al.
Publicado: (2024)
Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA
por: Chen, Guanhua, et al.
Publicado: (2026)
por: Chen, Guanhua, et al.
Publicado: (2026)
PlaSma: Making Small Language Models Better Procedural Knowledge Models for (Counterfactual) Planning
por: Brahman, Faeze, et al.
Publicado: (2023)
por: Brahman, Faeze, et al.
Publicado: (2023)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
por: Wang, Yuxia, et al.
Publicado: (2024)
por: Wang, Yuxia, et al.
Publicado: (2024)
Piecing Together Clues: A Benchmark for Evaluating the Detective Skills of Large Language Models
por: Gu, Zhouhong, et al.
Publicado: (2023)
por: Gu, Zhouhong, et al.
Publicado: (2023)
Tip of the Tongue Query Elicitation for Simulated Evaluation
por: He, Yifan, et al.
Publicado: (2025)
por: He, Yifan, et al.
Publicado: (2025)
The Price of Prompting: Profiling Energy Use in Large Language Models Inference
por: Husom, Erik Johannes, et al.
Publicado: (2024)
por: Husom, Erik Johannes, et al.
Publicado: (2024)
Assessing "Implicit" Retrieval Robustness of Large Language Models
por: Shen, Xiaoyu, et al.
Publicado: (2024)
por: Shen, Xiaoyu, et al.
Publicado: (2024)
Enabling Language Models to Implicitly Learn Self-Improvement
por: Wang, Ziqi, et al.
Publicado: (2023)
por: Wang, Ziqi, et al.
Publicado: (2023)
Human Evaluation of Procedural Knowledge Graph Extraction from Text with Large Language Models
por: Carriero, Valentina Anita, et al.
Publicado: (2024)
por: Carriero, Valentina Anita, et al.
Publicado: (2024)
Ejemplares similares
-
Benchmarking Procedural Language Understanding for Low-Resource Languages: A Case Study on Turkish
por: Uzunoglu, Arda, et al.
Publicado: (2023) -
Instructional Text Across Disciplines: A Survey of Representations, Downstream Tasks, and Open Challenges Toward Capable AI Agents
por: Safa, Abdulfattah, et al.
Publicado: (2024) -
A Zero-Shot Open-Vocabulary Pipeline for Dialogue Understanding
por: Safa, Abdulfattah, et al.
Publicado: (2024) -
Linguistically-Informed Multilingual Instruction Tuning: Is There an Optimal Set of Languages to Tune?
por: Soykan, Gürkan, et al.
Publicado: (2024) -
GECTurk WEB: An Explainable Online Platform for Turkish Grammatical Error Detection and Correction
por: Gebeşçe, Ali, et al.
Publicado: (2024)