Scaling LLM Planning: NL2FLOW for Parametric Problem Generation and Rigorous Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Kang, Jungkoo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Some Orders Are Important: Partially Preserving Orders in Top-Quality Planning
par: Katz, Michael, et autres
Publié: (2024)
par: Katz, Michael, et autres
Publié: (2024)
NL2Plan: Robust LLM-Driven Planning from Minimal Text Descriptions
par: Gestrin, Elliot, et autres
Publié: (2024)
par: Gestrin, Elliot, et autres
Publié: (2024)
Planning Anything with Rigor: General-Purpose Zero-Shot Planning with LLM-based Formalized Programming
par: Hao, Yilun, et autres
Publié: (2024)
par: Hao, Yilun, et autres
Publié: (2024)
Hybrid-NL2SVA: Integrating RAG and Finetuning for LLM-based NL2SVA
par: Xiao, Weihua, et autres
Publié: (2025)
par: Xiao, Weihua, et autres
Publié: (2025)
Evaluating NL2SQL via SQL2NL
par: Safarzadeh, Mohammadtaher, et autres
Publié: (2025)
par: Safarzadeh, Mohammadtaher, et autres
Publié: (2025)
Make Planning Research Rigorous Again!
par: Katz, Michael, et autres
Publié: (2025)
par: Katz, Michael, et autres
Publié: (2025)
ROSE: An Intent-Centered Evaluation Metric for NL2SQL
par: Pei, Wenqi, et autres
Publié: (2026)
par: Pei, Wenqi, et autres
Publié: (2026)
NL2SQLBench: A Modular Benchmarking Framework for LLM-Enabled NL2SQL Solutions
par: Hou, Shizheng, et autres
Publié: (2026)
par: Hou, Shizheng, et autres
Publié: (2026)
BIS: NL2SQL Service Evaluation Benchmark for Business Intelligence Scenarios
par: Caglayan, Bora, et autres
Publié: (2024)
par: Caglayan, Bora, et autres
Publié: (2024)
RESTestBench: A Benchmark for Evaluating the Effectiveness of LLM-Generated REST API Test Cases from NL Requirements
par: Kogler, Leon, et autres
Publié: (2026)
par: Kogler, Leon, et autres
Publié: (2026)
LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
par: Yang, Chang, et autres
Publié: (2024)
par: Yang, Chang, et autres
Publié: (2024)
MCCoder: Streamlining Motion Control with LLM-Assisted Code Generation and Rigorous Verification
par: Li, Yin, et autres
Publié: (2024)
par: Li, Yin, et autres
Publié: (2024)
Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities
par: Che, Zora, et autres
Publié: (2025)
par: Che, Zora, et autres
Publié: (2025)
OraPlan-SQL: A Planning-Centric Framework for Complex Bilingual NL2SQL Reasoning
par: Liu, Marianne Menglin, et autres
Publié: (2025)
par: Liu, Marianne Menglin, et autres
Publié: (2025)
Live API-Bench: 2500+ Live APIs for Testing Multi-Step Tool Calling
par: Elder, Benjamin, et autres
Publié: (2025)
par: Elder, Benjamin, et autres
Publié: (2025)
NL2Dashboard: A Lightweight and Controllable Framework for Generating Dashboards with LLMs
par: Shi, Boshen, et autres
Publié: (2026)
par: Shi, Boshen, et autres
Publié: (2026)
Is Long Context All You Need? Leveraging LLM's Extended Context for NL2SQL
par: Chung, Yeounoh, et autres
Publié: (2025)
par: Chung, Yeounoh, et autres
Publié: (2025)
STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator
par: Sordo, Alessio, et autres
Publié: (2026)
par: Sordo, Alessio, et autres
Publié: (2026)
Stop Automating Peer Review Without Rigorous Evaluation
par: Baumann, Joachim, et autres
Publié: (2026)
par: Baumann, Joachim, et autres
Publié: (2026)
MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation
par: Shbita, Basel, et autres
Publié: (2025)
par: Shbita, Basel, et autres
Publié: (2025)
Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction
par: Zhang, Zhe, et autres
Publié: (2025)
par: Zhang, Zhe, et autres
Publié: (2025)
FLOW-BENCH: Towards Conversational Generation of Enterprise Workflows
par: Duesterwald, Evelyn, et autres
Publié: (2025)
par: Duesterwald, Evelyn, et autres
Publié: (2025)
NL2Formula: Generating Spreadsheet Formulas from Natural Language Queries
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
LLM NL2SQL Robustness: Surface Noise vs. Linguistic Variation in Traditional and Agentic Settings
par: Tu, Lifu, et autres
Publié: (2026)
par: Tu, Lifu, et autres
Publié: (2026)
How Efficient is LLM-Generated Code? A Rigorous & High-Standard Benchmark
par: Qiu, Ruizhong, et autres
Publié: (2024)
par: Qiu, Ruizhong, et autres
Publié: (2024)
CausalProfiler: Generating Synthetic Benchmarks for Rigorous and Transparent Evaluation of Causal Machine Learning
par: Panayiotou, Panayiotis, et autres
Publié: (2025)
par: Panayiotou, Panayiotis, et autres
Publié: (2025)
LOGICPO: Efficient Translation of NL-based Logical Problems to FOL using LLMs and Preference Optimization
par: Viswanadha, Koushik, et autres
Publié: (2025)
par: Viswanadha, Koushik, et autres
Publié: (2025)
Agentic NL2SQL to Reduce Computational Costs
par: Jehle, Dominik, et autres
Publié: (2025)
par: Jehle, Dominik, et autres
Publié: (2025)
NL2CA: Auto-formalizing Cognitive Decision-Making from Natural Language Using an Unsupervised CriticNL2LTL Framework
par: Deng, Zihao, et autres
Publié: (2025)
par: Deng, Zihao, et autres
Publié: (2025)
OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems
par: Li, Xiaozhe, et autres
Publié: (2025)
par: Li, Xiaozhe, et autres
Publié: (2025)
Evaluation of an LLM in Identifying Logical Fallacies: A Call for Rigor When Adopting LLMs in HCI Research
par: Lim, Gionnieve, et autres
Publié: (2024)
par: Lim, Gionnieve, et autres
Publié: (2024)
VeriTrans: Fine-Tuned LLM-Assisted NL-to-PL Translation via a Deterministic Neuro-Symbolic Pipeline
par: Liu, Xuan, et autres
Publié: (2026)
par: Liu, Xuan, et autres
Publié: (2026)
Blar-SQL: Faster, Stronger, Smaller NL2SQL
par: Domínguez, José Manuel, et autres
Publié: (2024)
par: Domínguez, José Manuel, et autres
Publié: (2024)
Successor-Generator Planning with LLM-generated Heuristics
par: Tuisov, Alexander, et autres
Publié: (2025)
par: Tuisov, Alexander, et autres
Publié: (2025)
AGENTCL: Toward Rigorous Evaluation of Continual Learning in Language Agents
par: Shu, Yiheng, et autres
Publié: (2026)
par: Shu, Yiheng, et autres
Publié: (2026)
Neural Incompatibility: The Unbridgeable Gap of Cross-Scale Parametric Knowledge Transfer in Large Language Models
par: Tan, Yuqiao, et autres
Publié: (2025)
par: Tan, Yuqiao, et autres
Publié: (2025)
Position: AI Competitions Provide the Gold Standard for Empirical Rigor in GenAI Evaluation
par: Sculley, D., et autres
Publié: (2025)
par: Sculley, D., et autres
Publié: (2025)
Benchmark Test-Time Scaling of General LLM Agents
par: Li, Xiaochuan, et autres
Publié: (2026)
par: Li, Xiaochuan, et autres
Publié: (2026)
Planetarium: A Rigorous Benchmark for Translating Text to Structured Planning Languages
par: Zuo, Max, et autres
Publié: (2024)
par: Zuo, Max, et autres
Publié: (2024)
Hierarchical Task Network Planning with LLM-Generated Heuristics
par: Meneguzzi, Felipe, et autres
Publié: (2026)
par: Meneguzzi, Felipe, et autres
Publié: (2026)
Documents similaires
-
Some Orders Are Important: Partially Preserving Orders in Top-Quality Planning
par: Katz, Michael, et autres
Publié: (2024) -
NL2Plan: Robust LLM-Driven Planning from Minimal Text Descriptions
par: Gestrin, Elliot, et autres
Publié: (2024) -
Planning Anything with Rigor: General-Purpose Zero-Shot Planning with LLM-based Formalized Programming
par: Hao, Yilun, et autres
Publié: (2024) -
Hybrid-NL2SVA: Integrating RAG and Finetuning for LLM-based NL2SVA
par: Xiao, Weihua, et autres
Publié: (2025) -
Evaluating NL2SQL via SQL2NL
par: Safarzadeh, Mohammadtaher, et autres
Publié: (2025)