Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Mohan, G. Madan, Nambiar, Veena Kiran, Janardhan, Kiranmayee |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Deep Learning-Based Approach for Automatic 2D and 3D MRI Segmentation of Gliomas
por: Janardhan, Kiranmayee, et al.
Publicado: (2025)
por: Janardhan, Kiranmayee, et al.
Publicado: (2025)
A Systematic Review of Algorithmic Red Teaming Methodologies for Assurance and Security of AI Applications
por: Srivastava, Shruti, et al.
Publicado: (2026)
por: Srivastava, Shruti, et al.
Publicado: (2026)
Subclass Classification of Gliomas Using MRI Fusion Technique
por: Janardhan, Kiranmayee, et al.
Publicado: (2025)
por: Janardhan, Kiranmayee, et al.
Publicado: (2025)
Comparative Evaluation of Traditional Methods and Deep Learning for Brain Glioma Imaging. Review Paper
por: Janardhan, Kiranmayee, et al.
Publicado: (2026)
por: Janardhan, Kiranmayee, et al.
Publicado: (2026)
Towards a Benchmark for Large Language Models for Business Process Management Tasks
por: Busch, Kiran, et al.
Publicado: (2024)
por: Busch, Kiran, et al.
Publicado: (2024)
Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems
por: Cui, Tianyu, et al.
Publicado: (2024)
por: Cui, Tianyu, et al.
Publicado: (2024)
When Large Language Models Meet Law: Dual-Lens Taxonomy, Technical Advances, and Ethical Governance
por: Shao, Peizhang, et al.
Publicado: (2025)
por: Shao, Peizhang, et al.
Publicado: (2025)
MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding
por: Jiang, Mohan, et al.
Publicado: (2025)
por: Jiang, Mohan, et al.
Publicado: (2025)
Code Evolution Graphs: Understanding Large Language Model Driven Design of Algorithms
por: van Stein, Niki, et al.
Publicado: (2025)
por: van Stein, Niki, et al.
Publicado: (2025)
A Code Comprehension Benchmark for Large Language Models for Code
por: Havare, Jayant, et al.
Publicado: (2025)
por: Havare, Jayant, et al.
Publicado: (2025)
Code-Driven Planning in Grid Worlds with Large Language Models
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025)
por: Aravindan, Ashwath Vaithinathan, et al.
Publicado: (2025)
Hallucination by Code Generation LLMs: Taxonomy, Benchmarks, Mitigation, and Challenges
por: Lee, Yunseo, et al.
Publicado: (2025)
por: Lee, Yunseo, et al.
Publicado: (2025)
Early Discoveries of Algorithmist I: Promise of Provable Algorithm Synthesis at Scale
por: Kulkarni, Janardhan
Publicado: (2026)
por: Kulkarni, Janardhan
Publicado: (2026)
The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comprehensive Empirical Analysis of the CHC-LLM Incompatibility
por: Reddy, Mohan
Publicado: (2025)
por: Reddy, Mohan
Publicado: (2025)
Where Code Meets Natural Language: Taxonomy-Driven Information Flow Analysis for LLM-Integrated Applications
por: Xu, Zihao, et al.
Publicado: (2026)
por: Xu, Zihao, et al.
Publicado: (2026)
DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation
por: Hu, Wenhao, et al.
Publicado: (2025)
por: Hu, Wenhao, et al.
Publicado: (2025)
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
por: Huang, Yiming, et al.
Publicado: (2024)
por: Huang, Yiming, et al.
Publicado: (2024)
Structural Rigidity and the 57-Token Predictive Window: A Physical Framework for Inference-Layer Governability in Large Language Models
por: Ruddell, Gregory M.
Publicado: (2026)
por: Ruddell, Gregory M.
Publicado: (2026)
Enriching Taxonomies Using Large Language Models
por: Ghamlouch, Zeinab, et al.
Publicado: (2025)
por: Ghamlouch, Zeinab, et al.
Publicado: (2025)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
por: Fu, Lingyue, et al.
Publicado: (2023)
por: Fu, Lingyue, et al.
Publicado: (2023)
From Code to Play: Benchmarking Program Search for Games Using Large Language Models
por: Eberhardinger, Manuel, et al.
Publicado: (2024)
por: Eberhardinger, Manuel, et al.
Publicado: (2024)
SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth
por: Xing, Wenpeng, et al.
Publicado: (2025)
por: Xing, Wenpeng, et al.
Publicado: (2025)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
por: Padwal, Vedant
Publicado: (2026)
por: Padwal, Vedant
Publicado: (2026)
Are Large Language Models a Good Replacement of Taxonomies?
por: Sun, Yushi, et al.
Publicado: (2024)
por: Sun, Yushi, et al.
Publicado: (2024)
Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents
por: V, Arunkumar, et al.
Publicado: (2026)
por: V, Arunkumar, et al.
Publicado: (2026)
FoodTaxo: Generating Food Taxonomies with Large Language Models
por: Wullschleger, Pascal, et al.
Publicado: (2025)
por: Wullschleger, Pascal, et al.
Publicado: (2025)
Large Language Model-Driven Code Compliance Checking in Building Information Modeling
por: Madireddy, Soumya, et al.
Publicado: (2025)
por: Madireddy, Soumya, et al.
Publicado: (2025)
When Large Language Models contradict humans? Large Language Models' Sycophantic Behaviour
por: Ranaldi, Leonardo, et al.
Publicado: (2023)
por: Ranaldi, Leonardo, et al.
Publicado: (2023)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models
por: Meaden, James, et al.
Publicado: (2025)
por: Meaden, James, et al.
Publicado: (2025)
How Propense Are Large Language Models at Producing Code Smells? A Benchmarking Study
por: Velasco, Alejandro, et al.
Publicado: (2024)
por: Velasco, Alejandro, et al.
Publicado: (2024)
AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Challenges in Testing Large Language Model Based Software: A Faceted Taxonomy
por: Dobslaw, Felix, et al.
Publicado: (2025)
por: Dobslaw, Felix, et al.
Publicado: (2025)
Refining Wikidata Taxonomy using Large Language Models
por: Peng, Yiwen, et al.
Publicado: (2024)
por: Peng, Yiwen, et al.
Publicado: (2024)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
por: He, Yibo, et al.
Publicado: (2025)
por: He, Yibo, et al.
Publicado: (2025)
A Taxonomy of Stereotype Content in Large Language Models
por: Nicolas, Gandalf, et al.
Publicado: (2024)
por: Nicolas, Gandalf, et al.
Publicado: (2024)
Glioma Classification using Multi-sequence MRI and Novel Wavelets-based Feature Fusion
por: Janardhan, Kiranmayee, et al.
Publicado: (2025)
por: Janardhan, Kiranmayee, et al.
Publicado: (2025)
SoK: Taxonomy and Evaluation of Prompt Security in Large Language Models
por: Hong, Hanbin, et al.
Publicado: (2025)
por: Hong, Hanbin, et al.
Publicado: (2025)
Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights
por: Chen, Wenbo, et al.
Publicado: (2026)
por: Chen, Wenbo, et al.
Publicado: (2026)
Engineering Reasoning and Instruction (ERI) Benchmark: A Large Taxonomy-driven Dataset for Foundation Models and Agents
por: Naser, MZ, et al.
Publicado: (2026)
por: Naser, MZ, et al.
Publicado: (2026)
Ejemplares similares
-
Deep Learning-Based Approach for Automatic 2D and 3D MRI Segmentation of Gliomas
por: Janardhan, Kiranmayee, et al.
Publicado: (2025) -
A Systematic Review of Algorithmic Red Teaming Methodologies for Assurance and Security of AI Applications
por: Srivastava, Shruti, et al.
Publicado: (2026) -
Subclass Classification of Gliomas Using MRI Fusion Technique
por: Janardhan, Kiranmayee, et al.
Publicado: (2025) -
Comparative Evaluation of Traditional Methods and Deep Learning for Brain Glioma Imaging. Review Paper
por: Janardhan, Kiranmayee, et al.
Publicado: (2026) -
Towards a Benchmark for Large Language Models for Business Process Management Tasks
por: Busch, Kiran, et al.
Publicado: (2024)