Case Study: Testing Model Capabilities in Some Reasoning Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Min, Takumi, Sato, Zhang, Jack, Wang, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Socrates or Smartypants: Testing Logic Reasoning Capabilities of Large Language Models with Logic Programming-based Test Oracles
di: Xu, Zihao, et al.
Pubblicazione: (2025)
di: Xu, Zihao, et al.
Pubblicazione: (2025)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
di: Wong, Annie, et al.
Pubblicazione: (2025)
di: Wong, Annie, et al.
Pubblicazione: (2025)
WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
Evaluating Accounting Reasoning Capabilities of Large Language Models
di: Zhou, Jie, et al.
Pubblicazione: (2026)
di: Zhou, Jie, et al.
Pubblicazione: (2026)
Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
di: Nakamura, Taishi, et al.
Pubblicazione: (2025)
di: Nakamura, Taishi, et al.
Pubblicazione: (2025)
Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks
di: Wu, Zhaofeng, et al.
Pubblicazione: (2023)
di: Wu, Zhaofeng, et al.
Pubblicazione: (2023)
CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task
di: Mo, Haosi, et al.
Pubblicazione: (2025)
di: Mo, Haosi, et al.
Pubblicazione: (2025)
Mathematical Reasoning Enhanced LLM for Formula Derivation: A Case Study on Fiber NLI Modellin
di: Zhang, Yao, et al.
Pubblicazione: (2026)
di: Zhang, Yao, et al.
Pubblicazione: (2026)
Exploring the System 1 Thinking Capability of Large Reasoning Models
di: Zhang, Wenyuan, et al.
Pubblicazione: (2025)
di: Zhang, Wenyuan, et al.
Pubblicazione: (2025)
Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
Leveraging Reasoning Model Answers to Enhance Non-Reasoning Model Capability
di: Wang, Haotian, et al.
Pubblicazione: (2025)
di: Wang, Haotian, et al.
Pubblicazione: (2025)
Reasoning Vectors: Transferring Chain-of-Thought Capabilities via Task Arithmetic
di: Zbeeb, Mohammad, et al.
Pubblicazione: (2025)
di: Zbeeb, Mohammad, et al.
Pubblicazione: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
di: Tang, Liyan, et al.
Pubblicazione: (2025)
di: Tang, Liyan, et al.
Pubblicazione: (2025)
Phenomenal Yet Puzzling: Testing Inductive Reasoning Capabilities of Language Models with Hypothesis Refinement
di: Qiu, Linlu, et al.
Pubblicazione: (2023)
di: Qiu, Linlu, et al.
Pubblicazione: (2023)
Are Your LLMs Capable of Stable Reasoning?
di: Liu, Junnan, et al.
Pubblicazione: (2024)
di: Liu, Junnan, et al.
Pubblicazione: (2024)
Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law
di: Ge, Qiming, et al.
Pubblicazione: (2025)
di: Ge, Qiming, et al.
Pubblicazione: (2025)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
di: Wang, Wentian, et al.
Pubblicazione: (2024)
di: Wang, Wentian, et al.
Pubblicazione: (2024)
Neural-Symbolic Collaborative Distillation: Advancing Small Language Models for Complex Reasoning Tasks
di: Liao, Huanxuan, et al.
Pubblicazione: (2024)
di: Liao, Huanxuan, et al.
Pubblicazione: (2024)
Optimizing Case-Based Reasoning System for Functional Test Script Generation with Large Language Models
di: Guo, Siyuan, et al.
Pubblicazione: (2025)
di: Guo, Siyuan, et al.
Pubblicazione: (2025)
Reasoning Capabilities and Invariability of Large Language Models
di: Raganato, Alessandro, et al.
Pubblicazione: (2025)
di: Raganato, Alessandro, et al.
Pubblicazione: (2025)
Dynamic Embeddings with Task-Oriented prompting
di: Balloccu, Allmin, et al.
Pubblicazione: (2024)
di: Balloccu, Allmin, et al.
Pubblicazione: (2024)
Make Some Noise: Unlocking Language Model Parallel Inference Capability through Noisy Training
di: Wang, Yixuan, et al.
Pubblicazione: (2024)
di: Wang, Yixuan, et al.
Pubblicazione: (2024)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
LLM for Complex Reasoning Task: An Exploratory Study in Fermi Problems
di: Liu, Zishuo, et al.
Pubblicazione: (2025)
di: Liu, Zishuo, et al.
Pubblicazione: (2025)
Re-TASK: Revisiting LLM Tasks from Capability, Skill, and Knowledge Perspectives
di: Wang, Zhihu, et al.
Pubblicazione: (2024)
di: Wang, Zhihu, et al.
Pubblicazione: (2024)
NaturalThoughts: Selecting and Distilling Reasoning Traces for General Reasoning Tasks
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
Adaptive Detoxification: Safeguarding General Capabilities of LLMs through Toxicity-Aware Knowledge Editing
di: Lu, Yifan, et al.
Pubblicazione: (2025)
di: Lu, Yifan, et al.
Pubblicazione: (2025)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
di: Wang, Ruida, et al.
Pubblicazione: (2025)
di: Wang, Ruida, et al.
Pubblicazione: (2025)
Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks
di: Wang, Xinhe, et al.
Pubblicazione: (2025)
di: Wang, Xinhe, et al.
Pubblicazione: (2025)
What Are the Odds? Language Models Are Capable of Probabilistic Reasoning
di: Paruchuri, Akshay, et al.
Pubblicazione: (2024)
di: Paruchuri, Akshay, et al.
Pubblicazione: (2024)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
STEP: Staged Parameter-Efficient Pre-training for Large Language Models
di: Yano, Kazuki, et al.
Pubblicazione: (2025)
di: Yano, Kazuki, et al.
Pubblicazione: (2025)
DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
Unleashing LLM Reasoning Capability via Scalable Question Synthesis from Scratch
di: Ding, Yuyang, et al.
Pubblicazione: (2024)
di: Ding, Yuyang, et al.
Pubblicazione: (2024)
Improving Reasoning Capabilities in Small Models through Mixture-of-Layers Distillation with Stepwise Attention on Key Information
di: Chen, Yao, et al.
Pubblicazione: (2026)
di: Chen, Yao, et al.
Pubblicazione: (2026)
AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time
di: Zhang, Junyu, et al.
Pubblicazione: (2025)
di: Zhang, Junyu, et al.
Pubblicazione: (2025)
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
di: Zhao, Jun, et al.
Pubblicazione: (2024)
di: Zhao, Jun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Socrates or Smartypants: Testing Logic Reasoning Capabilities of Large Language Models with Logic Programming-based Test Oracles
di: Xu, Zihao, et al.
Pubblicazione: (2025) -
Reasoning Capabilities of Large Language Models on Dynamic Tasks
di: Wong, Annie, et al.
Pubblicazione: (2025) -
WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
di: Wang, Rui, et al.
Pubblicazione: (2025) -
Evaluating Accounting Reasoning Capabilities of Large Language Models
di: Zhou, Jie, et al.
Pubblicazione: (2026) -
Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
di: Nakamura, Taishi, et al.
Pubblicazione: (2025)