Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ruan, Kai, Wang, Xuan, Hong, Jixiang, Wang, Peng, Liu, Yang, Sun, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Flow of Reasoning: Training LLMs for Divergent Reasoning with Minimal Examples
par: Yu, Fangxu, et autres
Publié: (2024)
par: Yu, Fangxu, et autres
Publié: (2024)
EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs
par: Xu, Wanghan, et autres
Publié: (2025)
par: Xu, Wanghan, et autres
Publié: (2025)
CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning
par: Cui, Hao, et autres
Publié: (2025)
par: Cui, Hao, et autres
Publié: (2025)
Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments
par: Ye, Bingyang, et autres
Publié: (2026)
par: Ye, Bingyang, et autres
Publié: (2026)
Are Your LLMs Capable of Stable Reasoning?
par: Liu, Junnan, et autres
Publié: (2024)
par: Liu, Junnan, et autres
Publié: (2024)
When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning
par: Zhu, Rongzhi, et autres
Publié: (2025)
par: Zhu, Rongzhi, et autres
Publié: (2025)
Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation Capabilities
par: Wang, Hanbin, et autres
Publié: (2025)
par: Wang, Hanbin, et autres
Publié: (2025)
Think Carefully and Check Again! Meta-Generation Unlocking LLMs for Low-Resource Cross-Lingual Summarization
par: Li, Zhecheng, et autres
Publié: (2024)
par: Li, Zhecheng, et autres
Publié: (2024)
FlowPIE: Test-Time Scientific Idea Evolution with Flow-Guided Literature Exploration
par: Wang, Qiyao, et autres
Publié: (2026)
par: Wang, Qiyao, et autres
Publié: (2026)
KAG-Thinker: Interactive Thinking and Deep Reasoning in LLMs via Knowledge-Augmented Generation
par: Zhang, Dalong, et autres
Publié: (2025)
par: Zhang, Dalong, et autres
Publié: (2025)
Interesting Scientific Idea Generation using Knowledge Graphs and LLMs: Evaluations with 100 Research Group Leaders
par: Gu, Xuemei, et autres
Publié: (2024)
par: Gu, Xuemei, et autres
Publié: (2024)
Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's Capabilities
par: Liu, Zhichen, et autres
Publié: (2026)
par: Liu, Zhichen, et autres
Publié: (2026)
Demystifying Hybrid Thinking: Can LLMs Truly Switch Between Think and No-Think?
par: Wang, Shouren, et autres
Publié: (2025)
par: Wang, Shouren, et autres
Publié: (2025)
An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs
par: Vyas, Kaustubh, et autres
Publié: (2025)
par: Vyas, Kaustubh, et autres
Publié: (2025)
LLM as Attention-Informed NTM and Topic Modeling as long-input Generation: Interpretability and long-Context Capability
par: Xu, Xuan, et autres
Publié: (2025)
par: Xu, Xuan, et autres
Publié: (2025)
Evaluating Zero-Shot Long-Context LLM Compression
par: Wang, Chenyu, et autres
Publié: (2024)
par: Wang, Chenyu, et autres
Publié: (2024)
Explore the Reasoning Capability of LLMs in the Chess Testbed
par: Wang, Shu, et autres
Publié: (2024)
par: Wang, Shu, et autres
Publié: (2024)
ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities
par: Hong, Zhaochen, et autres
Publié: (2025)
par: Hong, Zhaochen, et autres
Publié: (2025)
StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
par: Yang, Jialin, et autres
Publié: (2025)
par: Yang, Jialin, et autres
Publié: (2025)
Structured Thinking Matters: Improving LLMs Generalization in Causal Inference Tasks
par: Sun, Wentao, et autres
Publié: (2025)
par: Sun, Wentao, et autres
Publié: (2025)
Memory-Driven Role-Playing: Evaluation and Enhancement of Persona Knowledge Utilization in LLMs
par: Wang, Kai, et autres
Publié: (2026)
par: Wang, Kai, et autres
Publié: (2026)
SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization
par: Sun, Huashan, et autres
Publié: (2025)
par: Sun, Huashan, et autres
Publié: (2025)
MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs
par: Zeng, Zhongshen, et autres
Publié: (2024)
par: Zeng, Zhongshen, et autres
Publié: (2024)
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
par: Bertsch, Amanda, et autres
Publié: (2025)
par: Bertsch, Amanda, et autres
Publié: (2025)
How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMs
par: Feng, Guhao, et autres
Publié: (2024)
par: Feng, Guhao, et autres
Publié: (2024)
When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models
par: Wang, Kai, et autres
Publié: (2025)
par: Wang, Kai, et autres
Publié: (2025)
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence
par: Wang, Yiheng, et autres
Publié: (2025)
par: Wang, Yiheng, et autres
Publié: (2025)
CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs
par: Liu, Hongtao, et autres
Publié: (2025)
par: Liu, Hongtao, et autres
Publié: (2025)
From Oracle to Noisy Context: Mitigating Contextual Exposure Bias in Speech-LLMs
par: Guo, Xiaoyong, et autres
Publié: (2026)
par: Guo, Xiaoyong, et autres
Publié: (2026)
Thinking LLMs: General Instruction Following with Thought Generation
par: Wu, Tianhao, et autres
Publié: (2024)
par: Wu, Tianhao, et autres
Publié: (2024)
Assessing the Capabilities of LLMs in Humor:A Multi-dimensional Analysis of Oogiri Generation and Evaluation
par: Sakabe, Ritsu, et autres
Publié: (2025)
par: Sakabe, Ritsu, et autres
Publié: (2025)
Is LLM an Overconfident Judge? Unveiling the Capabilities of LLMs in Detecting Offensive Language with Annotation Disagreement
par: Lu, Junyu, et autres
Publié: (2025)
par: Lu, Junyu, et autres
Publié: (2025)
AI Idea Bench 2025: AI Research Idea Generation Benchmark
par: Qiu, Yansheng, et autres
Publié: (2025)
par: Qiu, Yansheng, et autres
Publié: (2025)
Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialogues
par: Kwon, Deuksin, et autres
Publié: (2024)
par: Kwon, Deuksin, et autres
Publié: (2024)
To Retrieve or To Think? An Agentic Approach for Context Evolution
par: Chen, Rubing, et autres
Publié: (2026)
par: Chen, Rubing, et autres
Publié: (2026)
Think-J: Learning to Think for Generative LLM-as-a-Judge
par: Huang, Hui, et autres
Publié: (2025)
par: Huang, Hui, et autres
Publié: (2025)
Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning
par: Yang, Wang, et autres
Publié: (2025)
par: Yang, Wang, et autres
Publié: (2025)
Exploring the System 1 Thinking Capability of Large Reasoning Models
par: Zhang, Wenyuan, et autres
Publié: (2025)
par: Zhang, Wenyuan, et autres
Publié: (2025)
Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows
par: Xu, Wanghan, et autres
Publié: (2025)
par: Xu, Wanghan, et autres
Publié: (2025)
Evaluation of Multilingual LLMs Personalized Text Generation Capabilities Targeting Groups and Social-Media Platforms
par: Macko, Dominik
Publié: (2026)
par: Macko, Dominik
Publié: (2026)
Documents similaires
-
Flow of Reasoning: Training LLMs for Divergent Reasoning with Minimal Examples
par: Yu, Fangxu, et autres
Publié: (2024) -
EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs
par: Xu, Wanghan, et autres
Publié: (2025) -
CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning
par: Cui, Hao, et autres
Publié: (2025) -
Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments
par: Ye, Bingyang, et autres
Publié: (2026) -
Are Your LLMs Capable of Stable Reasoning?
par: Liu, Junnan, et autres
Publié: (2024)