Open Grounded Planning: Challenges and Benchmark Construction
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Shiguang, Deng, Ziliang, Lin, Hongyu, Lu, Yaojie, Han, Xianpei, Sun, Le |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Rule or Story, Which is a Better Commonsense Expression for Talking with Large Language Models?
by: Bian, Ning, et al.
Published: (2024)
by: Bian, Ning, et al.
Published: (2024)
REInstruct: Building Instruction Data from Unlabeled Corpus
by: Chen, Shu, et al.
Published: (2024)
by: Chen, Shu, et al.
Published: (2024)
Executing Natural Language-Described Algorithms with Large Language Models: An Investigation
by: Zheng, Xin, et al.
Published: (2024)
by: Zheng, Xin, et al.
Published: (2024)
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
by: Li, Zhuoqun, et al.
Published: (2024)
by: Li, Zhuoqun, et al.
Published: (2024)
READoc: A Unified Benchmark for Realistic Document Structured Extraction
by: Li, Zichao, et al.
Published: (2024)
by: Li, Zichao, et al.
Published: (2024)
Few-shot Named Entity Recognition via Superposition Concept Discrimination
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
Multi-Facet Counterfactual Learning for Content Quality Evaluation
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction
by: Zhong, Tianyun, et al.
Published: (2025)
by: Zhong, Tianyun, et al.
Published: (2025)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
by: Zheng, Jiasheng, et al.
Published: (2024)
by: Zheng, Jiasheng, et al.
Published: (2024)
SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency
by: Yuan, Qianhao, et al.
Published: (2025)
by: Yuan, Qianhao, et al.
Published: (2025)
A Unified View of Delta Parameter Editing in Post-Trained Large-Scale Models
by: Tang, Qiaoyu, et al.
Published: (2024)
by: Tang, Qiaoyu, et al.
Published: (2024)
SoFA: Shielded On-the-fly Alignment via Priority Rule Following
by: Lu, Xinyu, et al.
Published: (2024)
by: Lu, Xinyu, et al.
Published: (2024)
LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
by: Peng, Xiaoxuan, et al.
Published: (2026)
by: Peng, Xiaoxuan, et al.
Published: (2026)
AI for social science and social science of AI: A Survey
by: Xu, Ruoxi, et al.
Published: (2024)
by: Xu, Ruoxi, et al.
Published: (2024)
RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback
by: Tang, Qiaoyu, et al.
Published: (2025)
by: Tang, Qiaoyu, et al.
Published: (2025)
ChatGPT is a Knowledgeable but Inexperienced Solver: An Investigation of Commonsense Problem in Large Language Models
by: Bian, Ning, et al.
Published: (2023)
by: Bian, Ning, et al.
Published: (2023)
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
by: Yuan, Qianhao, et al.
Published: (2026)
by: Yuan, Qianhao, et al.
Published: (2026)
The Life Cycle of Knowledge in Big Language Models: A Survey
by: Cao, Boxi, et al.
Published: (2023)
by: Cao, Boxi, et al.
Published: (2023)
Seg2Act: Global Context-aware Action Generation for Document Logical Structuring
by: Li, Zichao, et al.
Published: (2024)
by: Li, Zichao, et al.
Published: (2024)
PaperRegister: Boosting Flexible-grained Paper Search via Hierarchical Register Indexing
by: Li, Zhuoqun, et al.
Published: (2025)
by: Li, Zhuoqun, et al.
Published: (2025)
The Rise and Down of Babel Tower: Investigating the Evolution Process of Multilingual Code Large Language Model
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
by: Ren, Mengjie, et al.
Published: (2026)
by: Ren, Mengjie, et al.
Published: (2026)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
by: Xiang, Hao, et al.
Published: (2024)
by: Xiang, Hao, et al.
Published: (2024)
Transferable Post-training via Inverse Value Learning
by: Lu, Xinyu, et al.
Published: (2024)
by: Lu, Xinyu, et al.
Published: (2024)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
by: Xiang, Hao, et al.
Published: (2025)
by: Xiang, Hao, et al.
Published: (2025)
Academically intelligent LLMs are not necessarily socially intelligent
by: Xu, Ruoxi, et al.
Published: (2024)
by: Xu, Ruoxi, et al.
Published: (2024)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
by: Yuan, Qianhao, et al.
Published: (2025)
by: Yuan, Qianhao, et al.
Published: (2025)
Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination
by: Zheng, Jiasheng, et al.
Published: (2026)
by: Zheng, Jiasheng, et al.
Published: (2026)
DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point Thinking
by: Li, Zhuoqun, et al.
Published: (2025)
by: Li, Zhuoqun, et al.
Published: (2025)
Coupled Variational Reinforcement Learning for Language Model General Reasoning
by: Wen, Xueru, et al.
Published: (2025)
by: Wen, Xueru, et al.
Published: (2025)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
by: Mao, Yingzhi, et al.
Published: (2025)
by: Mao, Yingzhi, et al.
Published: (2025)
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
by: Yuan, Qianhao, et al.
Published: (2025)
by: Yuan, Qianhao, et al.
Published: (2025)
Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic
by: Zheng, Xin, et al.
Published: (2024)
by: Zheng, Xin, et al.
Published: (2024)
ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch
by: Chen, Jiawei, et al.
Published: (2025)
by: Chen, Jiawei, et al.
Published: (2025)
AI-Salesman: Towards Reliable Large Language Model Driven Telemarketing
by: Zhang, Qingyu, et al.
Published: (2025)
by: Zhang, Qingyu, et al.
Published: (2025)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
by: Liang, Qiao, et al.
Published: (2025)
by: Liang, Qiao, et al.
Published: (2025)
ShortGPT: Layers in Large Language Models are More Redundant Than You Expect
by: Men, Xin, et al.
Published: (2024)
by: Men, Xin, et al.
Published: (2024)
Memorizing is Not Enough: Deep Knowledge Injection Through Reasoning
by: Xu, Ruoxi, et al.
Published: (2025)
by: Xu, Ruoxi, et al.
Published: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
by: Ma, Zhengzhao, et al.
Published: (2026)
by: Ma, Zhengzhao, et al.
Published: (2026)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
by: Liu, Yanjiang, et al.
Published: (2025)
by: Liu, Yanjiang, et al.
Published: (2025)
Similar Items
-
Rule or Story, Which is a Better Commonsense Expression for Talking with Large Language Models?
by: Bian, Ning, et al.
Published: (2024) -
REInstruct: Building Instruction Data from Unlabeled Corpus
by: Chen, Shu, et al.
Published: (2024) -
Executing Natural Language-Described Algorithms with Large Language Models: An Investigation
by: Zheng, Xin, et al.
Published: (2024) -
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
by: Li, Zhuoqun, et al.
Published: (2024) -
READoc: A Unified Benchmark for Realistic Document Structured Extraction
by: Li, Zichao, et al.
Published: (2024)