METIS: Mentoring Engine for Thoughtful Inquiry & Solutions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kumar, Abhinav Rajeev, Trehan, Dhruv, Chopra, Paras |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts
par: Trehan, Dhruv, et autres
Publié: (2026)
par: Trehan, Dhruv, et autres
Publié: (2026)
The Sequential Edge: Inverse-Entropy Voting Beats Parallel Self-Consistency at Matched Compute
par: Sharma, Aman, et autres
Publié: (2025)
par: Sharma, Aman, et autres
Publié: (2025)
Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
par: Sharma, Aman, et autres
Publié: (2025)
par: Sharma, Aman, et autres
Publié: (2025)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
par: Sharma, Aman, et autres
Publié: (2026)
par: Sharma, Aman, et autres
Publié: (2026)
Hybrid Neural World Models
par: Lakshmanan, Pranav, et autres
Publié: (2026)
par: Lakshmanan, Pranav, et autres
Publié: (2026)
Discovering Reinforcement Learning Interfaces with Large Language Models
par: Jaswal, Akshat Singh, et autres
Publié: (2026)
par: Jaswal, Akshat Singh, et autres
Publié: (2026)
Building Interpretable Models for Moral Decision-Making
par: Goel, Mayank, et autres
Publié: (2026)
par: Goel, Mayank, et autres
Publié: (2026)
Do GFlowNets Transfer? Case Study on the Game of 24/42
par: Gupta, Adesh, et autres
Publié: (2025)
par: Gupta, Adesh, et autres
Publié: (2025)
Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations
par: Gupta, Manan, et autres
Publié: (2026)
par: Gupta, Manan, et autres
Publié: (2026)
Latent Phase-Shift Rollback: Inference-Time Error Correction via Residual Stream Monitoring and KV-Cache Steering
par: Gupta, Manan, et autres
Publié: (2026)
par: Gupta, Manan, et autres
Publié: (2026)
PhyPlan: Generalizable and Rapid Physical Task Planning with Physics Informed Skill Networks for Robot Manipulators
par: Chopra, Mudit, et autres
Publié: (2024)
par: Chopra, Mudit, et autres
Publié: (2024)
SQuARE: Sequential Question Answering Reasoning Engine for Enhanced Chain-of-Thought in Large Language Models
par: Fleischer, Daniel, et autres
Publié: (2025)
par: Fleischer, Daniel, et autres
Publié: (2025)
Getting By Goal Misgeneralization With a Little Help From a Mentor
par: Trinh, Tu, et autres
Publié: (2024)
par: Trinh, Tu, et autres
Publié: (2024)
Causal Feature Selection for Responsible Machine Learning
par: Moraffah, Raha, et autres
Publié: (2024)
par: Moraffah, Raha, et autres
Publié: (2024)
Geometry of Human Perceptual Domains Emerges Transiently in LLM Representations
par: Singh, Simardeep, et autres
Publié: (2026)
par: Singh, Simardeep, et autres
Publié: (2026)
See, Symbolize, Act: Grounding VLMs with Spatial Representations for Better Gameplay
par: Baghel, Ashish, et autres
Publié: (2026)
par: Baghel, Ashish, et autres
Publié: (2026)
VoiceAgentBench: Are Voice Assistants ready for agentic tasks?
par: Jain, Dhruv, et autres
Publié: (2025)
par: Jain, Dhruv, et autres
Publié: (2025)
When Chain-of-Thought Fails, the Solution Hides in the Hidden States
par: Mehrafarin, Houman, et autres
Publié: (2026)
par: Mehrafarin, Houman, et autres
Publié: (2026)
Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts
par: Ahmed, Ammar, et autres
Publié: (2025)
par: Ahmed, Ammar, et autres
Publié: (2025)
ThinkSwitch: Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks
par: Saini, Dhruv, et autres
Publié: (2026)
par: Saini, Dhruv, et autres
Publié: (2026)
A Temporally Augmented Graph Attention Network for Affordance Classification
par: Chopra, Ami, et autres
Publié: (2026)
par: Chopra, Ami, et autres
Publié: (2026)
Everything of Thoughts: Defying the Law of Penrose Triangle for Thought Generation
par: Ding, Ruomeng, et autres
Publié: (2023)
par: Ding, Ruomeng, et autres
Publié: (2023)
time2time: Causal Intervention in Hidden States to Simulate Rare Events in Time Series Foundation Models
par: Sanyal, Debdeep, et autres
Publié: (2025)
par: Sanyal, Debdeep, et autres
Publié: (2025)
Future Is Unevenly Distributed: Forecasting Ability of LLMs Depends on What We're Asking
par: Karkar, Chinmay, et autres
Publié: (2025)
par: Karkar, Chinmay, et autres
Publié: (2025)
TrueGradeAI: Retrieval-Augmented and Bias-Resistant AI for Transparent and Explainable Digital Assessments
par: Thakur, Rakesh, et autres
Publié: (2025)
par: Thakur, Rakesh, et autres
Publié: (2025)
Continuous Thought Machines
par: Darlow, Luke, et autres
Publié: (2025)
par: Darlow, Luke, et autres
Publié: (2025)
Unveiling the Impact of Macroeconomic Policies: A Double Machine Learning Approach to Analyzing Interest Rate Effects on Financial Markets
par: Kumar, Anoop, et autres
Publié: (2024)
par: Kumar, Anoop, et autres
Publié: (2024)
ALAS: Autonomous Learning Agent for Self-Updating Language Models
par: Atreja, Dhruv
Publié: (2025)
par: Atreja, Dhruv
Publié: (2025)
Safe Reinforcement Learning for Real-World Engine Control
par: Bedei, Julian, et autres
Publié: (2025)
par: Bedei, Julian, et autres
Publié: (2025)
Scaling Is All You Need: Autonomous Driving with JAX-Accelerated Reinforcement Learning
par: Harmel, Moritz, et autres
Publié: (2023)
par: Harmel, Moritz, et autres
Publié: (2023)
Towards Interpretable Hate Speech Detection using Large Language Model-extracted Rationales
par: Nirmal, Ayushi, et autres
Publié: (2024)
par: Nirmal, Ayushi, et autres
Publié: (2024)
History Rhymes: Macro-Contextual Retrieval for Robust Financial Forecasting
par: Khanna, Sarthak, et autres
Publié: (2025)
par: Khanna, Sarthak, et autres
Publié: (2025)
Context Over Content: Exposing Evaluation Faking in Automated Judges
par: Gupta, Manan, et autres
Publié: (2026)
par: Gupta, Manan, et autres
Publié: (2026)
Ehrenfeucht-Haussler Rank and Chain of Thought
par: Barceló, Pablo, et autres
Publié: (2025)
par: Barceló, Pablo, et autres
Publié: (2025)
Activation Steering for Chain-of-Thought Compression
par: Azizi, Seyedarmin, et autres
Publié: (2025)
par: Azizi, Seyedarmin, et autres
Publié: (2025)
Autoformalizing Natural Language to First-Order Logic: A Case Study in Logical Fallacy Detection
par: Lalwani, Abhinav, et autres
Publié: (2024)
par: Lalwani, Abhinav, et autres
Publié: (2024)
Reasoning with Latent Thoughts: On the Power of Looped Transformers
par: Saunshi, Nikunj, et autres
Publié: (2025)
par: Saunshi, Nikunj, et autres
Publié: (2025)
View From Above: A Framework for Evaluating Distribution Shifts in Model Behavior
par: Chopra, Tanush, et autres
Publié: (2024)
par: Chopra, Tanush, et autres
Publié: (2024)
Language Models Entangle Language and Culture
par: Jain, Shourya, et autres
Publié: (2026)
par: Jain, Shourya, et autres
Publié: (2026)
HAEPO: History-Aggregated Exploratory Policy Optimization
par: Trivedi, Gaurish, et autres
Publié: (2025)
par: Trivedi, Gaurish, et autres
Publié: (2025)
Documents similaires
-
Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts
par: Trehan, Dhruv, et autres
Publié: (2026) -
The Sequential Edge: Inverse-Entropy Voting Beats Parallel Self-Consistency at Matched Compute
par: Sharma, Aman, et autres
Publié: (2025) -
Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
par: Sharma, Aman, et autres
Publié: (2025) -
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
par: Sharma, Aman, et autres
Publié: (2026) -
Hybrid Neural World Models
par: Lakshmanan, Pranav, et autres
Publié: (2026)