SBAN: A Framework & Multi-Dimensional Dataset for Large Language Model Pre-Training and Software Code Mining
Fuente:
arXiv
Saved in:
| Main Authors: | Jelodar, Hamed, Meymani, Mohammad, Bai, Samita, Razavi-Far, Roozbeh, Ghorbani, Ali A. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation
by: Hamedi, Parisa, et al.
Published: (2025)
by: Hamedi, Parisa, et al.
Published: (2025)
Large Language Models (LLMs) for Source Code Analysis: applications, models and datasets
by: Jelodar, Hamed, et al.
Published: (2025)
by: Jelodar, Hamed, et al.
Published: (2025)
Can Small GenAI Language Models Rival Large Language Models in Understanding Application Behavior?
by: Meymani, Mohammad, et al.
Published: (2025)
by: Meymani, Mohammad, et al.
Published: (2025)
XGen-Q: An Explainable Domain-Adaptive LLM Framework with Retrieval-Augmented Generation for Software Security
by: Jelodar, Hamed, et al.
Published: (2025)
by: Jelodar, Hamed, et al.
Published: (2025)
Integrating Graphs, Large Language Models, and Agents: Reasoning and Retrieval
by: Jelodar, Hamed, et al.
Published: (2026)
by: Jelodar, Hamed, et al.
Published: (2026)
FlexiDataGen: An Adaptive LLM Framework for Dynamic Semantic Dataset Generation in Sensitive Domains
by: Jelodar, Hamed, et al.
Published: (2025)
by: Jelodar, Hamed, et al.
Published: (2025)
Large Language Model (LLM) for Software Security: Code Analysis, Malware Analysis, Reverse Engineering
by: Jelodar, Hamed, et al.
Published: (2025)
by: Jelodar, Hamed, et al.
Published: (2025)
LLM4CodeRE: Generative AI for Code Decompilation Analysis and Reverse Engineering
by: Jelodar, Hamed, et al.
Published: (2026)
by: Jelodar, Hamed, et al.
Published: (2026)
Automated Malware Family Classification using Weighted Hierarchical Ensembles of Large Language Models
by: Bai, Samita, et al.
Published: (2026)
by: Bai, Samita, et al.
Published: (2026)
NLD-LLM: A systematic framework for evaluating small language transformer models on natural language description
by: Jelodar, Hamed, et al.
Published: (2025)
by: Jelodar, Hamed, et al.
Published: (2025)
MGS3: A Multi-Granularity Self-Supervised Code Search Framework
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
Divided We Fall: Defending Against Adversarial Attacks via Soft-Gated Fractional Mixture-of-Experts with Randomized Adversarial Training
by: Meymani, Mohammad, et al.
Published: (2025)
by: Meymani, Mohammad, et al.
Published: (2025)
Deep Code Search with Naming-Agnostic Contrastive Multi-View Learning
by: Feng, Jiadong, et al.
Published: (2024)
by: Feng, Jiadong, et al.
Published: (2024)
SweRank: Software Issue Localization with Code Ranking
by: Reddy, Revanth Gangi, et al.
Published: (2025)
by: Reddy, Revanth Gangi, et al.
Published: (2025)
ProCQA: A Large-scale Community-based Programming Question Answering Dataset for Code Search
by: Li, Zehan, et al.
Published: (2024)
by: Li, Zehan, et al.
Published: (2024)
The Impact Of Bug Localization Based on Crash Report Mining: A Developers' Perspective
by: Medeiros, Marcos, et al.
Published: (2024)
by: Medeiros, Marcos, et al.
Published: (2024)
Balanced Knowledge Distribution among Software Development Teams -- Observations from Open-Source and Closed-Source Software Development
by: Shafiq, Saad, et al.
Published: (2022)
by: Shafiq, Saad, et al.
Published: (2022)
Code-Craft: Hierarchical Graph-Based Code Summarization for Enhanced Context Retrieval
by: Sounthiraraj, David, et al.
Published: (2025)
by: Sounthiraraj, David, et al.
Published: (2025)
Use as Directed? A Comparison of Software Tools Intended to Check Rigor and Transparency of Published Work
by: Eckmann, Peter, et al.
Published: (2025)
by: Eckmann, Peter, et al.
Published: (2025)
Iterative Self-Training for Code Generation via Reinforced Re-Ranking
by: Sorokin, Nikita, et al.
Published: (2025)
by: Sorokin, Nikita, et al.
Published: (2025)
Supporting Cross-language Cross-project Bug Localization Using Pre-trained Language Models
by: Chandramohan, Mahinthan, et al.
Published: (2024)
by: Chandramohan, Mahinthan, et al.
Published: (2024)
Source Code Clone Detection Using Unsupervised Similarity Measures
by: Martinez-Gil, Jorge
Published: (2024)
by: Martinez-Gil, Jorge
Published: (2024)
Leveraging Graph-RAG and Prompt Engineering to Enhance LLM-Based Automated Requirement Traceability and Compliance Checks
by: Masoudifard, Arsalan, et al.
Published: (2024)
by: Masoudifard, Arsalan, et al.
Published: (2024)
GNN-Coder: Boosting Semantic Code Retrieval with Combined GNNs and Transformer
by: Ye, Yufan, et al.
Published: (2025)
by: Ye, Yufan, et al.
Published: (2025)
In-Context Learning as an Effective Estimator of Functional Correctness of LLM-Generated Code
by: Das, Susmita, et al.
Published: (2025)
by: Das, Susmita, et al.
Published: (2025)
Modular Layout Synthesis (MLS): Front-end Code via Structure Normalization and Constrained Generation
by: Liu, Chong, et al.
Published: (2025)
by: Liu, Chong, et al.
Published: (2025)
MRWeb: An Exploration of Generating Multi-Page Resource-Aware Web Code from UI Designs
by: Wan, Yuxuan, et al.
Published: (2024)
by: Wan, Yuxuan, et al.
Published: (2024)
An Empirical Study of Multi-Agent RAG for Real-World University Admissions Counseling
by: Nguyen-Duc, Anh, et al.
Published: (2025)
by: Nguyen-Duc, Anh, et al.
Published: (2025)
Multi-View Adaptive Contrastive Learning for Information Retrieval Based Fault Localization
by: Zhou, Chunying, et al.
Published: (2024)
by: Zhou, Chunying, et al.
Published: (2024)
Can Code Evaluation Metrics Detect Code Plagiarism?
by: Ebrahim, Fahad, et al.
Published: (2026)
by: Ebrahim, Fahad, et al.
Published: (2026)
SQuaD: The Software Quality Dataset
by: Robredo, Mikel, et al.
Published: (2025)
by: Robredo, Mikel, et al.
Published: (2025)
AI-assisted Coding with Cody: Lessons from Context Retrieval and Evaluation for Code Recommendations
by: Hartman, Jan, et al.
Published: (2024)
by: Hartman, Jan, et al.
Published: (2024)
DeepCodeSeek: Real-Time API Retrieval for Context-Aware Code Generation
by: Esakkiraja, Esakkivel, et al.
Published: (2025)
by: Esakkiraja, Esakkivel, et al.
Published: (2025)
CodeRAG: Finding Relevant and Necessary Knowledge for Retrieval-Augmented Repository-Level Code Completion
by: Zhang, Sheng, et al.
Published: (2025)
by: Zhang, Sheng, et al.
Published: (2025)
Examining the Usage of Generative AI Models in Student Learning Activities for Software Programming
by: Chen, Rufeng, et al.
Published: (2025)
by: Chen, Rufeng, et al.
Published: (2025)
Selective Shot Learning for Code Explanation
by: Bhattacharya, Paheli, et al.
Published: (2024)
by: Bhattacharya, Paheli, et al.
Published: (2024)
Rewriting the Code: A Simple Method for Large Language Model Augmented Code Search
by: Li, Haochen, et al.
Published: (2024)
by: Li, Haochen, et al.
Published: (2024)
LoRACode: LoRA Adapters for Code Embeddings
by: Chaturvedi, Saumya, et al.
Published: (2025)
by: Chaturvedi, Saumya, et al.
Published: (2025)
CPRet: A Dataset, Benchmark, and Model for Retrieval in Competitive Programming
by: Deng, Han, et al.
Published: (2025)
by: Deng, Han, et al.
Published: (2025)
Context-Augmented Code Generation Using Programming Knowledge Graphs
by: Saberi, Iman, et al.
Published: (2024)
by: Saberi, Iman, et al.
Published: (2024)
Similar Items
-
Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation
by: Hamedi, Parisa, et al.
Published: (2025) -
Large Language Models (LLMs) for Source Code Analysis: applications, models and datasets
by: Jelodar, Hamed, et al.
Published: (2025) -
Can Small GenAI Language Models Rival Large Language Models in Understanding Application Behavior?
by: Meymani, Mohammad, et al.
Published: (2025) -
XGen-Q: An Explainable Domain-Adaptive LLM Framework with Retrieval-Augmented Generation for Software Security
by: Jelodar, Hamed, et al.
Published: (2025) -
Integrating Graphs, Large Language Models, and Agents: Reasoning and Retrieval
by: Jelodar, Hamed, et al.
Published: (2026)