Enregistré dans:
| Auteurs principaux: | Srivastava, Saurabh, B, Annarose M, P V, Anto, Menon, Shashank, Sukumar, Ajay, T, Adwaith Samod, Philipose, Alan, Prince, Stevin, Thomas, Sooraj |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2402.19450 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Neurosymbolic Language Reasoning as Satisfiability Modulo Theory
par: Oh, Hyunseok, et autres
Publié: (2026)
par: Oh, Hyunseok, et autres
Publié: (2026)
DISCERN: Decoding Systematic Errors in Natural Language for Text Classifiers
par: Menon, Rakesh R., et autres
Publié: (2024)
par: Menon, Rakesh R., et autres
Publié: (2024)
The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning
par: Merrill, Scott, et autres
Publié: (2026)
par: Merrill, Scott, et autres
Publié: (2026)
An Objective Performance Evaluation of the LSTM Networks in Time Series Classification
par: Sunil, Sooraj, et autres
Publié: (2026)
par: Sunil, Sooraj, et autres
Publié: (2026)
Revisiting Prompt Optimization with Large Reasoning Models-A Case Study on Event Extraction
par: Srivastava, Saurabh, et autres
Publié: (2025)
par: Srivastava, Saurabh, et autres
Publié: (2025)
A Causal Lens for Evaluating Faithfulness Metrics
par: Zaman, Kerem, et autres
Publié: (2025)
par: Zaman, Kerem, et autres
Publié: (2025)
INTERACT: Enabling Interactive, Question-Driven Learning in Large Language Models
par: Kendapadi, Aum, et autres
Publié: (2024)
par: Kendapadi, Aum, et autres
Publié: (2024)
Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges
par: Quan, Pengrui, et autres
Publié: (2025)
par: Quan, Pengrui, et autres
Publié: (2025)
Evaluating Chain-of-Thought Reasoning through Reusability and Verifiability
par: Aggarwal, Shashank, et autres
Publié: (2026)
par: Aggarwal, Shashank, et autres
Publié: (2026)
Continuous Optimization for Decoding Errors
par: Srivastava, Shashank
Publié: (2024)
par: Srivastava, Shashank
Publié: (2024)
Improved List Size for Folded Reed-Solomon Codes
par: Srivastava, Shashank
Publié: (2024)
par: Srivastava, Shashank
Publié: (2024)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
par: Lin, Yueqian, et autres
Publié: (2025)
par: Lin, Yueqian, et autres
Publié: (2025)
Real-Time Performance Benchmarking of TinyML Models in Embedded Systems (PICO: Performance of Inference, CPU, and Operations)
par: Dey, Abhishek, et autres
Publié: (2025)
par: Dey, Abhishek, et autres
Publié: (2025)
Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning
par: Zhao, Boxiang, et autres
Publié: (2026)
par: Zhao, Boxiang, et autres
Publié: (2026)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
par: Bi, Zhenyu, et autres
Publié: (2025)
par: Bi, Zhenyu, et autres
Publié: (2025)
Bullous Lung Disease in Turner Syndrome: An Underrecognized Comorbidity?
par: Stevin Lu, et autres
Publié: (2024)
par: Stevin Lu, et autres
Publié: (2024)
Ai-Powered Sales Demand Forecasting and Desicion Support system
par: M, Nithin, et autres
Publié: (2026)
par: M, Nithin, et autres
Publié: (2026)
MetaCluster: Enabling Deep Compression of Kolmogorov-Arnold Network
par: Raffel, Matthew, et autres
Publié: (2025)
par: Raffel, Matthew, et autres
Publié: (2025)
Enhancing the Diagnostic Evaluation of Thyroid Functionality Using Diffuse Reflectance Spectroscopy and Regression Models
par: W. Anto Win Shalini, et autres
Publié: (2025)
par: W. Anto Win Shalini, et autres
Publié: (2025)
Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
par: Nichols, Daniel, et autres
Publié: (2025)
par: Nichols, Daniel, et autres
Publié: (2025)
Pharmacognostical and Preliminary phytochemical evaluation of Seed kernel of Chinchasthi (Tamarindus indica Linn)
par: MS Megha, et autres
Publié: (2026)
par: MS Megha, et autres
Publié: (2026)
The intersection of philosophy of language and artificial intelligence: Challenges in replicating human language understanding
par: Sooraj Kumar Maurya
Publié: (2024)
par: Sooraj Kumar Maurya
Publié: (2024)
Cost Trade-offs of Reasoning and Non-Reasoning Large Language Models in Text-to-SQL
par: Deochake, Saurabh, et autres
Publié: (2025)
par: Deochake, Saurabh, et autres
Publié: (2025)
An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models
par: Sun, Mingzhong, et autres
Publié: (2026)
par: Sun, Mingzhong, et autres
Publié: (2026)
Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering
par: Maharaj, Kishan, et autres
Publié: (2026)
par: Maharaj, Kishan, et autres
Publié: (2026)
Enhancing Domain-Specific Retrieval-Augmented Generation: Synthetic Data Generation and Evaluation using Reasoning Models
par: Jadon, Aryan, et autres
Publié: (2025)
par: Jadon, Aryan, et autres
Publié: (2025)
Therapeutic Potential Of M@B 40 (M = Mg and Ca) Fullerene as a Drug Delivery System for Gemcitabine Anti‐Lung Cancer Drug: A DFT Approach
par: Abisha Nancy Sukumar, et autres
Publié: (2025)
par: Abisha Nancy Sukumar, et autres
Publié: (2025)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
par: Stogiannidis, Ilias, et autres
Publié: (2025)
par: Stogiannidis, Ilias, et autres
Publié: (2025)
SocialGaze: Improving the Integration of Human Social Norms in Large Language Models
par: Vijjini, Anvesh Rao, et autres
Publié: (2024)
par: Vijjini, Anvesh Rao, et autres
Publié: (2024)
LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks
par: Ullah, Saad, et autres
Publié: (2023)
par: Ullah, Saad, et autres
Publié: (2023)
A Robust Placeability Metric for Model-Free Unified Pick-and-Place Reasoning
par: Wingender, Benno, et autres
Publié: (2025)
par: Wingender, Benno, et autres
Publié: (2025)
ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation
par: Oh, Jungwoo, et autres
Publié: (2026)
par: Oh, Jungwoo, et autres
Publié: (2026)
RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models
par: Wang, Yuqing, et autres
Publié: (2024)
par: Wang, Yuqing, et autres
Publié: (2024)
Autonomous Evaluation of LLMs for Truth Maintenance and Reasoning Tasks
par: Karia, Rushang, et autres
Publié: (2024)
par: Karia, Rushang, et autres
Publié: (2024)
Benchmarking Reasoning Robustness in Large Language Models
par: Yu, Tong, et autres
Publié: (2025)
par: Yu, Tong, et autres
Publié: (2025)
Mind the Gap: Evaluating the Representativeness of Quantitative Medical Language Reasoning LLM Benchmarks for African Disease Burdens
par: Mutisya, Fred, et autres
Publié: (2025)
par: Mutisya, Fred, et autres
Publié: (2025)
Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization
par: Zaman, Kerem, et autres
Publié: (2025)
par: Zaman, Kerem, et autres
Publié: (2025)
List Decoding Expander-Based Codes up to Capacity in Near-Linear Time
par: Srivastava, Shashank, et autres
Publié: (2025)
par: Srivastava, Shashank, et autres
Publié: (2025)
Point of Order: Action-Aware LLM Persona Modeling for Realistic Civic Simulation
par: Merrill, Scott, et autres
Publié: (2025)
par: Merrill, Scott, et autres
Publié: (2025)
MOAT: MobileNet‐Optimized Attention Transfer for Robust and Scalable Dermatology Image Classification
par: Pradeep Radhakrishnan, et autres
Publié: (2025)
par: Pradeep Radhakrishnan, et autres
Publié: (2025)
Documents similaires
-
Neurosymbolic Language Reasoning as Satisfiability Modulo Theory
par: Oh, Hyunseok, et autres
Publié: (2026) -
DISCERN: Decoding Systematic Errors in Natural Language for Text Classifiers
par: Menon, Rakesh R., et autres
Publié: (2024) -
The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning
par: Merrill, Scott, et autres
Publié: (2026) -
An Objective Performance Evaluation of the LSTM Networks in Time Series Classification
par: Sunil, Sooraj, et autres
Publié: (2026) -
Revisiting Prompt Optimization with Large Reasoning Models-A Case Study on Event Extraction
par: Srivastava, Saurabh, et autres
Publié: (2025)