What Are the Odds? Language Models Are Capable of Probabilistic Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Paruchuri, Akshay, Garrison, Jake, Liao, Shun, Hernandez, John, Sunshine, Jacob, Althoff, Tim, Liu, Xin, McDuff, Daniel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models
di: Gu, Ken, et al.
Pubblicazione: (2025)
di: Gu, Ken, et al.
Pubblicazione: (2025)
Transforming Wearable Data into Personal Health Insights using Large Language Model Agents
di: Merrill, Mike A., et al.
Pubblicazione: (2024)
di: Merrill, Mike A., et al.
Pubblicazione: (2024)
Substance over Style: Evaluating Proactive Conversational Coaching Agents
di: Srinivas, Vidya, et al.
Pubblicazione: (2025)
di: Srinivas, Vidya, et al.
Pubblicazione: (2025)
InvThink: Premortem Reasoning for Safer Language Models
di: Kim, Yubin, et al.
Pubblicazione: (2025)
di: Kim, Yubin, et al.
Pubblicazione: (2025)
RADAR: Benchmarking Language Models on Imperfect Tabular Data
di: Gu, Ken, et al.
Pubblicazione: (2025)
di: Gu, Ken, et al.
Pubblicazione: (2025)
Scaling Wearable Foundation Models
di: Narayanswamy, Girish, et al.
Pubblicazione: (2024)
di: Narayanswamy, Girish, et al.
Pubblicazione: (2024)
Health-LLM: Large Language Models for Health Prediction via Wearable Sensor Data
di: Kim, Yubin, et al.
Pubblicazione: (2024)
di: Kim, Yubin, et al.
Pubblicazione: (2024)
SensorLM: Learning the Language of Wearable Sensors
di: Zhang, Yuwei, et al.
Pubblicazione: (2025)
di: Zhang, Yuwei, et al.
Pubblicazione: (2025)
The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models
di: Paruchuri, Akshay, et al.
Pubblicazione: (2026)
di: Paruchuri, Akshay, et al.
Pubblicazione: (2026)
Language Models Still Struggle to Zero-shot Reason about Time Series
di: Merrill, Mike A., et al.
Pubblicazione: (2024)
di: Merrill, Mike A., et al.
Pubblicazione: (2024)
New Tools are Needed for Tracking Adherence to AI Model Behavioral Use Clauses
di: McDuff, Daniel, et al.
Pubblicazione: (2025)
di: McDuff, Daniel, et al.
Pubblicazione: (2025)
The chemistry of interstitial waters at DSDP Site 45-395
di: McDuff, Russell E
Pubblicazione: (1984)
di: McDuff, Russell E
Pubblicazione: (1984)
(Table 3) Chemistry in water at DSDP Site 45-395
di: McDuff, Russell E
Pubblicazione: (1984)
di: McDuff, Russell E
Pubblicazione: (1984)
(Table 2) Silicon and nitrate concentrations in water samples at DSDP Hole 45-395A
di: McDuff, Russell E
Pubblicazione: (1984)
di: McDuff, Russell E
Pubblicazione: (1984)
(Table 3) Interstitial water elemental composition at DSDP Leg 86 Holes
di: McDuff, Russell E
Pubblicazione: (1985)
di: McDuff, Russell E
Pubblicazione: (1985)
"What's Up, Doc?": Analyzing How Users Seek Health Information in Large-Scale Conversational AI Datasets
di: Paruchuri, Akshay, et al.
Pubblicazione: (2025)
di: Paruchuri, Akshay, et al.
Pubblicazione: (2025)
Reasoning Under Uncertainty: Exploring Probabilistic Reasoning Capabilities of LLMs
di: Pournemat, Mobina, et al.
Pubblicazione: (2025)
di: Pournemat, Mobina, et al.
Pubblicazione: (2025)
Evaluating Accounting Reasoning Capabilities of Large Language Models
di: Zhou, Jie, et al.
Pubblicazione: (2026)
di: Zhou, Jie, et al.
Pubblicazione: (2026)
Probabilistic Calibration Is a Trainable Capability in Language Models
di: Baldelli, Davide, et al.
Pubblicazione: (2026)
di: Baldelli, Davide, et al.
Pubblicazione: (2026)
A Demonstration of Adaptive Collaboration of Large Language Models for Medical Decision-Making
di: Kim, Yubin, et al.
Pubblicazione: (2024)
di: Kim, Yubin, et al.
Pubblicazione: (2024)
How Suboptimal is Training rPPG Models with Videos and Targets from Different Body Sites?
di: Braun, Björn, et al.
Pubblicazione: (2024)
di: Braun, Björn, et al.
Pubblicazione: (2024)
Polyfold fundamental classes and globally structured multivalued perturbations
di: McDuff, Dusa, et al.
Pubblicazione: (2024)
di: McDuff, Dusa, et al.
Pubblicazione: (2024)
Sesquicuspidal curves, scattering diagrams, and symplectic nonsqueezing
di: McDuff, Dusa, et al.
Pubblicazione: (2024)
di: McDuff, Dusa, et al.
Pubblicazione: (2024)
Singular algebraic curves and infinite symplectic staircases
di: McDuff, Dusa, et al.
Pubblicazione: (2024)
di: McDuff, Dusa, et al.
Pubblicazione: (2024)
Symplectic capacities, unperturbed curves, and convex toric domains
di: McDuff, Dusa, et al.
Pubblicazione: (2021)
di: McDuff, Dusa, et al.
Pubblicazione: (2021)
Reasoning Capabilities and Invariability of Large Language Models
di: Raganato, Alessandro, et al.
Pubblicazione: (2025)
di: Raganato, Alessandro, et al.
Pubblicazione: (2025)
Uneven Evolution of Cognition Across Generations of Generative AI Models
di: Galatzer-Levy, Isaac, et al.
Pubblicazione: (2026)
di: Galatzer-Levy, Isaac, et al.
Pubblicazione: (2026)
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
di: Shah, Kulin, et al.
Pubblicazione: (2024)
di: Shah, Kulin, et al.
Pubblicazione: (2024)
Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks
di: Wu, Zhaofeng, et al.
Pubblicazione: (2023)
di: Wu, Zhaofeng, et al.
Pubblicazione: (2023)
The Potential and Perils of Generative Artificial Intelligence for Quality Improvement and Patient Safety
di: Jalilian, Laleh, et al.
Pubblicazione: (2024)
di: Jalilian, Laleh, et al.
Pubblicazione: (2024)
Do Large Language Models Know What They Are Capable Of?
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
A Scalable Framework for Evaluating Health Language Models
di: Mallinar, Neil, et al.
Pubblicazione: (2025)
di: Mallinar, Neil, et al.
Pubblicazione: (2025)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
di: Wang, Wentian, et al.
Pubblicazione: (2024)
di: Wang, Wentian, et al.
Pubblicazione: (2024)
Towards Transparent Reasoning: What Drives Faithfulness in Large Language Models?
di: McMillan, Teague, et al.
Pubblicazione: (2025)
di: McMillan, Teague, et al.
Pubblicazione: (2025)
Self-Translate-Train: Enhancing Cross-Lingual Transfer of Large Language Models via Inherent Capability
di: Ri, Ryokan, et al.
Pubblicazione: (2024)
di: Ri, Ryokan, et al.
Pubblicazione: (2024)
Towards a Personal Health Large Language Model
di: Cosentino, Justin, et al.
Pubblicazione: (2024)
di: Cosentino, Justin, et al.
Pubblicazione: (2024)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
di: Wong, Annie, et al.
Pubblicazione: (2025)
di: Wong, Annie, et al.
Pubblicazione: (2025)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
di: Saxena, Yash, et al.
Pubblicazione: (2024)
di: Saxena, Yash, et al.
Pubblicazione: (2024)
Distilling Mathematical Reasoning Capabilities into Small Language Models
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
Facilitating Self-Guided Mental Health Interventions Through Human-Language Model Interaction: A Case Study of Cognitive Restructuring
di: Sharma, Ashish, et al.
Pubblicazione: (2023)
di: Sharma, Ashish, et al.
Pubblicazione: (2023)
Documenti analoghi
-
SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models
di: Gu, Ken, et al.
Pubblicazione: (2025) -
Transforming Wearable Data into Personal Health Insights using Large Language Model Agents
di: Merrill, Mike A., et al.
Pubblicazione: (2024) -
Substance over Style: Evaluating Proactive Conversational Coaching Agents
di: Srinivas, Vidya, et al.
Pubblicazione: (2025) -
InvThink: Premortem Reasoning for Safer Language Models
di: Kim, Yubin, et al.
Pubblicazione: (2025) -
RADAR: Benchmarking Language Models on Imperfect Tabular Data
di: Gu, Ken, et al.
Pubblicazione: (2025)