The Karp Dataset
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | DiCicco, Mason, Worden, Eamon, Olsen, Conner, Gangaram, Nikhil, Reichman, Daniel, Heffernan, Neil |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs
par: Worden, Eamon, et autres
Publié: (2026)
par: Worden, Eamon, et autres
Publié: (2026)
Nearest Neighbor Complexity and Boolean Circuits
par: DiCicco, Mason, et autres
Publié: (2024)
par: DiCicco, Mason, et autres
Publié: (2024)
Automated Feedback in Math Education: A Comparative Analysis of LLMs for Open-Ended Responses
par: Baral, Sami, et autres
Publié: (2024)
par: Baral, Sami, et autres
Publié: (2024)
Investigating the Robustness of Knowledge Tracing Models in the Presence of Student Concept Drift
par: Lee, Morgan, et autres
Publié: (2025)
par: Lee, Morgan, et autres
Publié: (2025)
An Improved Deep Learning Model for Word Embeddings Based Clustering for Large Text Datasets
par: Sutrakar, Vijay Kumar, et autres
Publié: (2025)
par: Sutrakar, Vijay Kumar, et autres
Publié: (2025)
Reading with Intent -- Neutralizing Intent
par: Reichman, Benjamin, et autres
Publié: (2025)
par: Reichman, Benjamin, et autres
Publié: (2025)
Loss-to-Loss Prediction: Scaling Laws for All Datasets
par: Brandfonbrener, David, et autres
Publié: (2024)
par: Brandfonbrener, David, et autres
Publié: (2024)
Emotion is Not Just a Label: Latent Emotional Factors in LLM Processing
par: Reichman, Benjamin, et autres
Publié: (2026)
par: Reichman, Benjamin, et autres
Publié: (2026)
Global Citizenship Education within a Context of Accountability and 21st Century Skills: The Case of Olympus High School
par: Marzia Cozzolino DiCicco
Publié: (2016)
par: Marzia Cozzolino DiCicco
Publié: (2016)
Speculative Streaming: Fast LLM Inference without Auxiliary Models
par: Bhendawade, Nikhil, et autres
Publié: (2024)
par: Bhendawade, Nikhil, et autres
Publié: (2024)
PLoP: Precise LoRA Placement for Efficient Finetuning of Large Models
par: Hayou, Soufiane, et autres
Publié: (2025)
par: Hayou, Soufiane, et autres
Publié: (2025)
Sparse Upcycling: Inference Inefficient Finetuning
par: Doubov, Sasha, et autres
Publié: (2024)
par: Doubov, Sasha, et autres
Publié: (2024)
Dataset Mention Extraction in Scientific Articles Using Bi-LSTM-CRF Model
par: Zeng, Tong, et autres
Publié: (2024)
par: Zeng, Tong, et autres
Publié: (2024)
Upsample or Upweight? Balanced Training on Heavily Imbalanced Datasets
par: Li, Tianjian, et autres
Publié: (2024)
par: Li, Tianjian, et autres
Publié: (2024)
Emotional RAG LLMs: Reading Comprehension for the Open Internet
par: Reichman, Benjamin, et autres
Publié: (2024)
par: Reichman, Benjamin, et autres
Publié: (2024)
Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
par: Sardana, Nikhil, et autres
Publié: (2023)
par: Sardana, Nikhil, et autres
Publié: (2023)
Simultaneous Reward Distillation and Preference Learning: Get You a Language Model Who Can Do Both
par: Nath, Abhijnan, et autres
Publié: (2024)
par: Nath, Abhijnan, et autres
Publié: (2024)
Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment
par: Pustejovsky, James, et autres
Publié: (2026)
par: Pustejovsky, James, et autres
Publié: (2026)
The Super Emotion Dataset
par: de Fortuny, Enric Junqué
Publié: (2025)
par: de Fortuny, Enric Junqué
Publié: (2025)
DiLM: Distilling Dataset into Language Model for Text-level Dataset Distillation
par: Maekawa, Aru, et autres
Publié: (2024)
par: Maekawa, Aru, et autres
Publié: (2024)
Scaling Open-Ended Reasoning to Predict the Future
par: Chandak, Nikhil, et autres
Publié: (2025)
par: Chandak, Nikhil, et autres
Publié: (2025)
KULCQ: An Unsupervised Keyword-based Utterance Level Clustering Quality Metric
par: Guruprasad, Pranav, et autres
Publié: (2024)
par: Guruprasad, Pranav, et autres
Publié: (2024)
The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text
par: Kandpal, Nikhil, et autres
Publié: (2025)
par: Kandpal, Nikhil, et autres
Publié: (2025)
MosaicBERT: A Bidirectional Encoder Optimized for Fast Pretraining
par: Portes, Jacob, et autres
Publié: (2023)
par: Portes, Jacob, et autres
Publié: (2023)
Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking
par: Prakash, Nikhil, et autres
Publié: (2024)
par: Prakash, Nikhil, et autres
Publié: (2024)
RE-GrievanceAssist: Enhancing Customer Experience through ML-Powered Complaint Management
par: C, Venkatesh, et autres
Publié: (2024)
par: C, Venkatesh, et autres
Publié: (2024)
RedPajama: an Open Dataset for Training Large Language Models
par: Weber, Maurice, et autres
Publié: (2024)
par: Weber, Maurice, et autres
Publié: (2024)
Position: The Most Expensive Part of an LLM should be its Training Data
par: Kandpal, Nikhil, et autres
Publié: (2025)
par: Kandpal, Nikhil, et autres
Publié: (2025)
Hype or not? Formalizing Automatic Promotional Language Detection in Biomedical Research
par: Batalo, Bojan, et autres
Publié: (2025)
par: Batalo, Bojan, et autres
Publié: (2025)
MAPLE: A Framework for Active Preference Learning Guided by Large Language Models
par: Mahmud, Saaduddin, et autres
Publié: (2024)
par: Mahmud, Saaduddin, et autres
Publié: (2024)
DORE: A Dataset For Portuguese Definition Generation
par: Furtado, Anna Beatriz Dimas, et autres
Publié: (2024)
par: Furtado, Anna Beatriz Dimas, et autres
Publié: (2024)
CIDAR: Culturally Relevant Instruction Dataset For Arabic
par: Alyafeai, Zaid, et autres
Publié: (2024)
par: Alyafeai, Zaid, et autres
Publié: (2024)
Recursive Abstractive Processing for Retrieval in Dynamic Datasets
par: Chucri, Charbel, et autres
Publié: (2024)
par: Chucri, Charbel, et autres
Publié: (2024)
Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes
par: Nath, Abhijnan, et autres
Publié: (2025)
par: Nath, Abhijnan, et autres
Publié: (2025)
The Impact of Initialization on LoRA Finetuning Dynamics
par: Hayou, Soufiane, et autres
Publié: (2024)
par: Hayou, Soufiane, et autres
Publié: (2024)
LoRA+: Efficient Low Rank Adaptation of Large Models
par: Hayou, Soufiane, et autres
Publié: (2024)
par: Hayou, Soufiane, et autres
Publié: (2024)
The Representational Status of Deep Learning Models
par: Duede, Eamon
Publié: (2023)
par: Duede, Eamon
Publié: (2023)
Datasets, Documents, and Repetitions: The Practicalities of Unequal Data Quality
par: Fang, Alex, et autres
Publié: (2025)
par: Fang, Alex, et autres
Publié: (2025)
Zero-Shot Conversational Stance Detection: Dataset and Approaches
par: Ding, Yuzhe, et autres
Publié: (2025)
par: Ding, Yuzhe, et autres
Publié: (2025)
FoQA: A Faroese Question-Answering Dataset
par: Simonsen, Annika, et autres
Publié: (2025)
par: Simonsen, Annika, et autres
Publié: (2025)
Documents similaires
-
FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs
par: Worden, Eamon, et autres
Publié: (2026) -
Nearest Neighbor Complexity and Boolean Circuits
par: DiCicco, Mason, et autres
Publié: (2024) -
Automated Feedback in Math Education: A Comparative Analysis of LLMs for Open-Ended Responses
par: Baral, Sami, et autres
Publié: (2024) -
Investigating the Robustness of Knowledge Tracing Models in the Presence of Student Concept Drift
par: Lee, Morgan, et autres
Publié: (2025) -
An Improved Deep Learning Model for Word Embeddings Based Clustering for Large Text Datasets
par: Sutrakar, Vijay Kumar, et autres
Publié: (2025)