Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework
Fuente:
arXiv
Guardado en:
| Autores principales: | Guan, Zihan, Datta, Rituparna, Hu, Mengxuan, Liu, Shunshun, Zhang, Aiying, Balachandran, Prasanna, Li, Sheng, Vullikanti, Anil |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety
por: Guan, Zihan, et al.
Publicado: (2025)
por: Guan, Zihan, et al.
Publicado: (2025)
UFID: A Unified Framework for Input-level Backdoor Detection on Diffusion Models
por: Guan, Zihan, et al.
Publicado: (2024)
por: Guan, Zihan, et al.
Publicado: (2024)
Agentic Framework for Epidemiological Modeling
por: Datta, Rituparna, et al.
Publicado: (2026)
por: Datta, Rituparna, et al.
Publicado: (2026)
Large Language Models Lack Temporal Awareness of Medical Knowledge
por: Guan, Zihan, et al.
Publicado: (2026)
por: Guan, Zihan, et al.
Publicado: (2026)
Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment
por: Hu, Mengxuan, et al.
Publicado: (2026)
por: Hu, Mengxuan, et al.
Publicado: (2026)
CALYPSO: Forecasting and Analyzing MRSA Infection Patterns with Community and Healthcare Transmission Dynamics
por: Datta, Rituparna, et al.
Publicado: (2025)
por: Datta, Rituparna, et al.
Publicado: (2025)
Large Language Models for Causal Discovery: Current Landscape and Future Directions
por: Wan, Guangya, et al.
Publicado: (2024)
por: Wan, Guangya, et al.
Publicado: (2024)
BalancEdit: Dynamically Balancing the Generality-Locality Trade-off in Multi-modal Model Editing
por: Guo, Dongliang, et al.
Publicado: (2025)
por: Guo, Dongliang, et al.
Publicado: (2025)
No Free Lunch: Retrieval-Augmented Generation Undermines Fairness in LLMs, Even for Vigilant Users
por: Hu, Mengxuan, et al.
Publicado: (2024)
por: Hu, Mengxuan, et al.
Publicado: (2024)
Mechanistic Decoding of Cognitive Constructs in Large Language Models
por: Shou, Yitong, et al.
Publicado: (2026)
por: Shou, Yitong, et al.
Publicado: (2026)
Enhanced Diagnostic Performance via Large-Resolution Inference Optimization for Pathology Foundation Models
por: Hu, Mengxuan, et al.
Publicado: (2026)
por: Hu, Mengxuan, et al.
Publicado: (2026)
MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2024)
por: Li, Shuyue Stella, et al.
Publicado: (2024)
Improving Hospital Risk Prediction with Knowledge-Augmented Multimodal EHR Modeling
por: Datta, Rituparna, et al.
Publicado: (2025)
por: Datta, Rituparna, et al.
Publicado: (2025)
Backdoor in Seconds: Unlocking Vulnerabilities in Large Pre-trained Models via Model Editing
por: Guo, Dongliang, et al.
Publicado: (2024)
por: Guo, Dongliang, et al.
Publicado: (2024)
Are LLMs Ready to Replace Bangla Annotators?
por: Hasan, Md. Najib, et al.
Publicado: (2026)
por: Hasan, Md. Najib, et al.
Publicado: (2026)
Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks
por: Kim, Dongjun, et al.
Publicado: (2025)
por: Kim, Dongjun, et al.
Publicado: (2025)
Differentially private exact recovery for stochastic block models
por: Nguyen, Dung, et al.
Publicado: (2024)
por: Nguyen, Dung, et al.
Publicado: (2024)
How Emotion Shapes the Behavior of LLMs and Agents: A Mechanistic Study
por: Sun, Moran, et al.
Publicado: (2026)
por: Sun, Moran, et al.
Publicado: (2026)
Differentially Private Densest Subgraph Detection
por: Nguyen, Dung, et al.
Publicado: (2021)
por: Nguyen, Dung, et al.
Publicado: (2021)
LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
por: Gao, Zihan, et al.
Publicado: (2025)
por: Gao, Zihan, et al.
Publicado: (2025)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
por: Qi, Yunjia, et al.
Publicado: (2025)
por: Qi, Yunjia, et al.
Publicado: (2025)
Are Today's LLMs Ready to Explain Well-Being Concepts?
por: Jiang, Bohan, et al.
Publicado: (2025)
por: Jiang, Bohan, et al.
Publicado: (2025)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
Are LLMs Court-Ready? Evaluating Frontier Models on Indian Legal Reasoning
por: Juvekar, Kush, et al.
Publicado: (2025)
por: Juvekar, Kush, et al.
Publicado: (2025)
Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective
por: Chandna, Bhavik, et al.
Publicado: (2025)
por: Chandna, Bhavik, et al.
Publicado: (2025)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
por: Ji, Wence, et al.
Publicado: (2025)
por: Ji, Wence, et al.
Publicado: (2025)
Orchard: An Open-Source Agentic Modeling Framework
por: Peng, Baolin, et al.
Publicado: (2026)
por: Peng, Baolin, et al.
Publicado: (2026)
MIB: A Mechanistic Interpretability Benchmark
por: Mueller, Aaron, et al.
Publicado: (2025)
por: Mueller, Aaron, et al.
Publicado: (2025)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
por: Wu, Junde, et al.
Publicado: (2025)
por: Wu, Junde, et al.
Publicado: (2025)
ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems
por: Zhang, Yifei, et al.
Publicado: (2026)
por: Zhang, Yifei, et al.
Publicado: (2026)
Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations
por: Wu, Yihao, et al.
Publicado: (2025)
por: Wu, Yihao, et al.
Publicado: (2025)
Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability
por: Raimondi, Bianca, et al.
Publicado: (2025)
por: Raimondi, Bianca, et al.
Publicado: (2025)
Agentic Confidence Calibration
por: Zhang, Jiaxin, et al.
Publicado: (2026)
por: Zhang, Jiaxin, et al.
Publicado: (2026)
LLM-based Agentic Reasoning Frameworks: A Survey from Methods to Scenarios
por: Zhao, Bingxi, et al.
Publicado: (2025)
por: Zhao, Bingxi, et al.
Publicado: (2025)
GEM: A Gym for Agentic LLMs
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
DHP Benchmark: Are LLMs Good NLG Evaluators?
por: Wang, Yicheng, et al.
Publicado: (2024)
por: Wang, Yicheng, et al.
Publicado: (2024)
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
por: Butt, Natasha, et al.
Publicado: (2024)
por: Butt, Natasha, et al.
Publicado: (2024)
The Evolution of RWKV: Advancements in Efficient Language Modeling
por: Datta, Akul
Publicado: (2024)
por: Datta, Akul
Publicado: (2024)
Mitigating Hallucination in Large Language Models (LLMs): An Application-Oriented Survey on RAG, Reasoning, and Agentic Systems
por: Li, Yihan, et al.
Publicado: (2025)
por: Li, Yihan, et al.
Publicado: (2025)
LLMs as Agentic Cooperative Players in Multiplayer UNO
por: Matinez, Yago Romano, et al.
Publicado: (2025)
por: Matinez, Yago Romano, et al.
Publicado: (2025)
Ejemplares similares
-
Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety
por: Guan, Zihan, et al.
Publicado: (2025) -
UFID: A Unified Framework for Input-level Backdoor Detection on Diffusion Models
por: Guan, Zihan, et al.
Publicado: (2024) -
Agentic Framework for Epidemiological Modeling
por: Datta, Rituparna, et al.
Publicado: (2026) -
Large Language Models Lack Temporal Awareness of Medical Knowledge
por: Guan, Zihan, et al.
Publicado: (2026) -
Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment
por: Hu, Mengxuan, et al.
Publicado: (2026)