Critical Insights into Leading Conversational AI Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kohli, Urja, Singh, Aditi, Sharma, Arun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment
par: Ansell, Rebecca, et autres
Publié: (2026)
par: Ansell, Rebecca, et autres
Publié: (2026)
ChatGPT4PCG Competition: Character-like Level Generation for Science Birds
par: Taveekitworachai, Pittawat, et autres
Publié: (2023)
par: Taveekitworachai, Pittawat, et autres
Publié: (2023)
REVOLVE: Optimizing AI Systems by Tracking Response Evolution in Textual Optimization
par: Zhang, Peiyan, et autres
Publié: (2024)
par: Zhang, Peiyan, et autres
Publié: (2024)
Reinforced Language Models for Sequential Decision Making
par: Dilkes, Jim, et autres
Publié: (2025)
par: Dilkes, Jim, et autres
Publié: (2025)
TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination
par: Li, Xu, et autres
Publié: (2026)
par: Li, Xu, et autres
Publié: (2026)
ChatGPT4PCG 2 Competition: Prompt Engineering for Science Birds Level Generation
par: Taveekitworachai, Pittawat, et autres
Publié: (2024)
par: Taveekitworachai, Pittawat, et autres
Publié: (2024)
REPOT: Recoverable Program-of-Thought via Checkpoint Repair
par: Mazaheri, Parsa
Publié: (2026)
par: Mazaheri, Parsa
Publié: (2026)
Assisting humans in complex comparisons: automated information comparison at scale
par: Yuen, Truman, et autres
Publié: (2024)
par: Yuen, Truman, et autres
Publié: (2024)
Aligning LLMs on a Budget: Inference-Time Alignment with Heuristic Reward Models
par: Nakamura, Mason, et autres
Publié: (2025)
par: Nakamura, Mason, et autres
Publié: (2025)
Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents
par: Chua, Jaymari, et autres
Publié: (2025)
par: Chua, Jaymari, et autres
Publié: (2025)
Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation
par: Koc, Vincent
Publié: (2025)
par: Koc, Vincent
Publié: (2025)
ReaGeo: Reasoning-Enhanced End-to-End Geocoding with LLMs
par: Cui, Jian, et autres
Publié: (2026)
par: Cui, Jian, et autres
Publié: (2026)
Automated Theorem Provers Help Improve Large Language Model Reasoning
par: McGinness, Lachlan, et autres
Publié: (2024)
par: McGinness, Lachlan, et autres
Publié: (2024)
Open-TI: Open Traffic Intelligence with Augmented Language Model
par: Da, Longchao, et autres
Publié: (2023)
par: Da, Longchao, et autres
Publié: (2023)
GraphEval36K: Benchmarking Coding and Reasoning Capabilities of Large Language Models on Graph Datasets
par: Wu, Qiming, et autres
Publié: (2024)
par: Wu, Qiming, et autres
Publié: (2024)
Dynamic Policy Induction for Adaptive Prompt Optimization: Bridging the Efficiency-Accuracy Gap via Lightweight Reinforcement Learning
par: Xu, Jiexi
Publié: (2025)
par: Xu, Jiexi
Publié: (2025)
Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy
par: He, Langzhou, et autres
Publié: (2026)
par: He, Langzhou, et autres
Publié: (2026)
Language Models, Graph Searching, and Supervision Adulteration: When More Supervision is Less and How to Make More More
par: Frydenlund, Arvid
Publié: (2025)
par: Frydenlund, Arvid
Publié: (2025)
Game of Thought: Robust Information Seeking with Large Language Models Using Game Theory
par: Cui, Langyuan, et autres
Publié: (2026)
par: Cui, Langyuan, et autres
Publié: (2026)
Navigating WebAI: Training Agents to Complete Web Tasks with Large Language Models and Reinforcement Learning
par: Thil, Lucas-Andreï, et autres
Publié: (2024)
par: Thil, Lucas-Andreï, et autres
Publié: (2024)
When Words Change the Model: Sensitivity of LLMs for Constraint Programming Modelling
par: Pellegrino, Alessio, et autres
Publié: (2025)
par: Pellegrino, Alessio, et autres
Publié: (2025)
FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation
par: Hildebrand, Samuel, et autres
Publié: (2025)
par: Hildebrand, Samuel, et autres
Publié: (2025)
GraphWalk: Enabling Reasoning in Large Language Models through Tool-Based Graph Navigation
par: Ghandi, Taraneh, et autres
Publié: (2026)
par: Ghandi, Taraneh, et autres
Publié: (2026)
Improving Existing Optimization Algorithms with LLMs
par: Sartori, Camilo Chacón, et autres
Publié: (2025)
par: Sartori, Camilo Chacón, et autres
Publié: (2025)
Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models
par: Steele, Brady, et autres
Publié: (2026)
par: Steele, Brady, et autres
Publié: (2026)
ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges
par: Zhou, Yue, et autres
Publié: (2025)
par: Zhou, Yue, et autres
Publié: (2025)
HELEA: Hard-Negative Benchmark and LLM-based Reranking for Robust Entity Alignment
par: Jang, Yoonjin, et autres
Publié: (2026)
par: Jang, Yoonjin, et autres
Publié: (2026)
TRACE: Temporal Rule-Anchored Chain-of-Evidence on Knowledge Graphs for Interpretable Stock Movement Prediction
par: Ding, Qianggang, et autres
Publié: (2026)
par: Ding, Qianggang, et autres
Publié: (2026)
Evo-DKD: Dual-Knowledge Decoding for Autonomous Ontology Evolution in Large Language Models
par: Raman, Vishal, et autres
Publié: (2025)
par: Raman, Vishal, et autres
Publié: (2025)
From Search to Reasoning: A Five-Level RAG Capability Framework for Enterprise Data
par: Gill, Gurbinder, et autres
Publié: (2025)
par: Gill, Gurbinder, et autres
Publié: (2025)
SCULPT: Constraint-Guided Pruned MCTS that Carves Efficient Paths for Mathematical Reasoning
par: Fang, Qitong, et autres
Publié: (2026)
par: Fang, Qitong, et autres
Publié: (2026)
On the Limits of Learned Importance Scoring for KV Cache Compression
par: Steele, Brady
Publié: (2026)
par: Steele, Brady
Publié: (2026)
REMoH: A Reflective Evolution of Multi-objective Heuristics approach via Large Language Models
par: Forniés-Tabuenca, Diego, et autres
Publié: (2025)
par: Forniés-Tabuenca, Diego, et autres
Publié: (2025)
Comparison of Unsupervised Metrics for Evaluating Judicial Decision Extraction
par: Litvak, Ivan Leonidovich, et autres
Publié: (2025)
par: Litvak, Ivan Leonidovich, et autres
Publié: (2025)
ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
AutoBench: Automating LLM Evaluation through Reciprocal Peer Assessment
par: Loi, Dario, et autres
Publié: (2025)
par: Loi, Dario, et autres
Publié: (2025)
Gyan: An Explainable Neuro-Symbolic Language Model
par: Srinivasan, Venkat, et autres
Publié: (2026)
par: Srinivasan, Venkat, et autres
Publié: (2026)
MESS+: Dynamically Learned Inference-Time LLM Routing in Model Zoos with Service Level Guarantees
par: Woisetschläger, Herbert, et autres
Publié: (2025)
par: Woisetschläger, Herbert, et autres
Publié: (2025)
Comparing Apples to Oranges: LLM-powered Multimodal Intention Prediction in an Object Categorization Task
par: Ali, Hassan, et autres
Publié: (2024)
par: Ali, Hassan, et autres
Publié: (2024)
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
par: Agrawal, Lakshya A, et autres
Publié: (2025)
par: Agrawal, Lakshya A, et autres
Publié: (2025)
Documents similaires
-
How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment
par: Ansell, Rebecca, et autres
Publié: (2026) -
ChatGPT4PCG Competition: Character-like Level Generation for Science Birds
par: Taveekitworachai, Pittawat, et autres
Publié: (2023) -
REVOLVE: Optimizing AI Systems by Tracking Response Evolution in Textual Optimization
par: Zhang, Peiyan, et autres
Publié: (2024) -
Reinforced Language Models for Sequential Decision Making
par: Dilkes, Jim, et autres
Publié: (2025) -
TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination
par: Li, Xu, et autres
Publié: (2026)