LLMs Can Plan Only If We Tell Them
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sel, Bilgehan, Jia, Ruoxi, Jin, Ming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Skin-in-the-Game: Decision Making via Multi-Stakeholder Alignment in LLMs
par: Sel, Bilgehan, et autres
Publié: (2024)
par: Sel, Bilgehan, et autres
Publié: (2024)
Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language Models
par: Sel, Bilgehan, et autres
Publié: (2023)
par: Sel, Bilgehan, et autres
Publié: (2023)
How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs
par: Zeng, Yi, et autres
Publié: (2024)
par: Zeng, Yi, et autres
Publié: (2024)
Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning
par: Sel, Bilgehan, et autres
Publié: (2026)
par: Sel, Bilgehan, et autres
Publié: (2026)
Backtracking for Safety
par: Sel, Bilgehan, et autres
Publié: (2025)
par: Sel, Bilgehan, et autres
Publié: (2025)
Reinforcement Learning with Backtracking Feedback
par: Sel, Bilgehan, et autres
Publié: (2026)
par: Sel, Bilgehan, et autres
Publié: (2026)
Retracing the Past: LLMs Emit Training Data When They Get Lost
par: Ko, Myeongseob, et autres
Publié: (2025)
par: Ko, Myeongseob, et autres
Publié: (2025)
Can We Locate and Prevent Stereotypes in LLMs?
par: D'Souza, Alex
Publié: (2026)
par: D'Souza, Alex
Publié: (2026)
FASTTRACK: Fast and Accurate Fact Tracing for LLMs
par: Chen, Si, et autres
Publié: (2024)
par: Chen, Si, et autres
Publié: (2024)
Language Agents Mirror Human Causal Reasoning Biases. How Can We Help Them Think Like Scientists?
par: GX-Chen, Anthony, et autres
Publié: (2025)
par: GX-Chen, Anthony, et autres
Publié: (2025)
Can We Edit LLMs for Long-Tail Biomedical Knowledge?
par: Yi, Xinhao, et autres
Publié: (2025)
par: Yi, Xinhao, et autres
Publié: (2025)
If You Can't Use Them, Recycle Them: Optimizing Merging at Scale Mitigates Performance Tradeoffs
par: Khalifa, Muhammad, et autres
Publié: (2024)
par: Khalifa, Muhammad, et autres
Publié: (2024)
Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
What Can String Probability Tell Us About Grammaticality?
par: Hu, Jennifer, et autres
Publié: (2025)
par: Hu, Jennifer, et autres
Publié: (2025)
LLMs Still Can't Plan; Can LRMs? A Preliminary Evaluation of OpenAI's o1 on PlanBench
par: Valmeekam, Karthik, et autres
Publié: (2024)
par: Valmeekam, Karthik, et autres
Publié: (2024)
LLM-REVal: Can We Trust LLM Reviewers Yet?
par: Li, Rui, et autres
Publié: (2025)
par: Li, Rui, et autres
Publié: (2025)
Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
par: Tie, Guiyao, et autres
Publié: (2025)
par: Tie, Guiyao, et autres
Publié: (2025)
How Can We Effectively Expand the Vocabulary of LLMs with 0.01GB of Target Language Text?
par: Yamaguchi, Atsuki, et autres
Publié: (2024)
par: Yamaguchi, Atsuki, et autres
Publié: (2024)
Can We Trust LLM Detectors?
par: Sandhan, Jivnesh, et autres
Publié: (2026)
par: Sandhan, Jivnesh, et autres
Publié: (2026)
Varying Shades of Wrong: Aligning LLMs with Wrong Answers Only
par: Yao, Jihan, et autres
Publié: (2024)
par: Yao, Jihan, et autres
Publié: (2024)
Will LLMs Replace the Encoder-Only Models in Temporal Relation Classification?
par: Roccabruna, Gabriel, et autres
Publié: (2024)
par: Roccabruna, Gabriel, et autres
Publié: (2024)
Show, Don't Tell: Uncovering Implicit Character Portrayal using LLMs
par: Jaipersaud, Brandon, et autres
Publié: (2024)
par: Jaipersaud, Brandon, et autres
Publié: (2024)
Can We Count on LLMs? The Fixed-Effect Fallacy and Claims of GPT-4 Capabilities
par: Ball, Thomas, et autres
Publié: (2024)
par: Ball, Thomas, et autres
Publié: (2024)
Can LLMs Generate Good Stories? Insights and Challenges from a Narrative Planning Perspective
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
AI-Generated Slides: Are They Good? Can Students Tell?
par: Leinonen, Juho, et autres
Publié: (2026)
par: Leinonen, Juho, et autres
Publié: (2026)
AGR: Age Group fairness Reward for Bias Mitigation in LLMs
par: Cao, Shuirong, et autres
Publié: (2024)
par: Cao, Shuirong, et autres
Publié: (2024)
LLMs for Relational Reasoning: How Far are We?
par: Li, Zhiming, et autres
Publié: (2024)
par: Li, Zhiming, et autres
Publié: (2024)
How Far Are We From AGI: Are LLMs All We Need?
par: Feng, Tao, et autres
Publié: (2024)
par: Feng, Tao, et autres
Publié: (2024)
Can Argus Judge Them All? Comparing VLMs Across Domains
par: Joshi, Harsh, et autres
Publié: (2025)
par: Joshi, Harsh, et autres
Publié: (2025)
Learning to Plan Before Answering: Self-Teaching LLMs to Learn Abstract Plans for Problem Solving
par: Zhang, Jin, et autres
Publié: (2025)
par: Zhang, Jin, et autres
Publié: (2025)
We Can't Understand AI Using our Existing Vocabulary
par: Hewitt, John, et autres
Publié: (2025)
par: Hewitt, John, et autres
Publié: (2025)
Can We Verify Step by Step for Incorrect Answer Detection?
par: Xu, Xin, et autres
Publié: (2024)
par: Xu, Xin, et autres
Publié: (2024)
Sydney Telling Fables on AI and Humans: A Corpus Tracing Memetic Transfer of Persona between LLMs
par: Milička, Jiří, et autres
Publié: (2026)
par: Milička, Jiří, et autres
Publié: (2026)
Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?
par: Zhang, Yudi, et autres
Publié: (2025)
par: Zhang, Yudi, et autres
Publié: (2025)
From Fallback to Frontline: When Can LLMs be Superior Annotators of Human Perspectives?
par: Amin, Hasan, et autres
Publié: (2026)
par: Amin, Hasan, et autres
Publié: (2026)
When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?
par: Zhou, Xinyu, et autres
Publié: (2026)
par: Zhou, Xinyu, et autres
Publié: (2026)
AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
par: Kang, Feiyang, et autres
Publié: (2024)
par: Kang, Feiyang, et autres
Publié: (2024)
Can LLMs Ask Good Questions?
par: Zhang, Yueheng, et autres
Publié: (2025)
par: Zhang, Yueheng, et autres
Publié: (2025)
Can LLMs Explain Themselves Counterfactually?
par: Dehghanighobadi, Zahra, et autres
Publié: (2025)
par: Dehghanighobadi, Zahra, et autres
Publié: (2025)
Can GNN be Good Adapter for LLMs?
par: Huang, Xuanwen, et autres
Publié: (2024)
par: Huang, Xuanwen, et autres
Publié: (2024)
Documents similaires
-
Skin-in-the-Game: Decision Making via Multi-Stakeholder Alignment in LLMs
par: Sel, Bilgehan, et autres
Publié: (2024) -
Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language Models
par: Sel, Bilgehan, et autres
Publié: (2023) -
How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs
par: Zeng, Yi, et autres
Publié: (2024) -
Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning
par: Sel, Bilgehan, et autres
Publié: (2026) -
Backtracking for Safety
par: Sel, Bilgehan, et autres
Publié: (2025)