CoPeP: Benchmarking Continual Pretraining for Protein Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Patil, Darshan, Malviya, Pranshu, Reymond, Mathieu, Fournier, Quentin, Chandar, Sarath |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Manifold Metric: A Loss Landscape Approach for Predicting Model Performance
par: Malviya, Pranshu, et autres
Publié: (2024)
par: Malviya, Pranshu, et autres
Publié: (2024)
Lookbehind-SAM: k steps back, 1 step forward
par: Mordido, Gonçalo, et autres
Publié: (2023)
par: Mordido, Gonçalo, et autres
Publié: (2023)
NovoMolGen: Rethinking Molecular Language Model Pretraining
par: Chitsaz, Kamran, et autres
Publié: (2025)
par: Chitsaz, Kamran, et autres
Publié: (2025)
Exploring Quantization for Efficient Pre-Training of Transformer Language Models
par: Chitsaz, Kamran, et autres
Publié: (2024)
par: Chitsaz, Kamran, et autres
Publié: (2024)
Intelligent Switching for Reset-Free RL
par: Patil, Darshan, et autres
Publié: (2024)
par: Patil, Darshan, et autres
Publié: (2024)
CrystalGym: A New Benchmark for Materials Discovery Using Reinforcement Learning
par: Govindarajan, Prashant, et autres
Publié: (2025)
par: Govindarajan, Prashant, et autres
Publié: (2025)
Squeezing More from the Stream : Learning Representation Online for Streaming Reinforcement Learning
par: Nilaksh, et autres
Publié: (2026)
par: Nilaksh, et autres
Publié: (2026)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
Torque-Aware Momentum
par: Malviya, Pranshu, et autres
Publié: (2024)
par: Malviya, Pranshu, et autres
Publié: (2024)
Promoting Exploration in Memory-Augmented Adam using Critical Momenta
par: Malviya, Pranshu, et autres
Publié: (2023)
par: Malviya, Pranshu, et autres
Publié: (2023)
Faithfulness Measurable Masked Language Models
par: Madsen, Andreas, et autres
Publié: (2023)
par: Madsen, Andreas, et autres
Publié: (2023)
Are self-explanations from Large Language Models faithful?
par: Madsen, Andreas, et autres
Publié: (2024)
par: Madsen, Andreas, et autres
Publié: (2024)
Toward Debugging Deep Reinforcement Learning Programs with RLExplorer
par: Bouchoucha, Rached, et autres
Publié: (2024)
par: Bouchoucha, Rached, et autres
Publié: (2024)
Context-Aware Assistant Selection for Improved Inference Acceleration with Large Language Models
par: Huang, Jerry, et autres
Publié: (2024)
par: Huang, Jerry, et autres
Publié: (2024)
Small Encoders Can Rival Large Decoders in Detecting Groundedness
par: Abbes, Istabrak, et autres
Publié: (2025)
par: Abbes, Istabrak, et autres
Publié: (2025)
Towards Practical Tool Usage for Continually Learning LLMs
par: Huang, Jerry, et autres
Publié: (2024)
par: Huang, Jerry, et autres
Publié: (2024)
Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models
par: Prato, Gabriele, et autres
Publié: (2025)
par: Prato, Gabriele, et autres
Publié: (2025)
Mastering Memory Tasks with World Models
par: Samsami, Mohammad Reza, et autres
Publié: (2024)
par: Samsami, Mohammad Reza, et autres
Publié: (2024)
Steering Large Language Model Activations in Sparse Spaces
par: Bayat, Reza, et autres
Publié: (2025)
par: Bayat, Reza, et autres
Publié: (2025)
Sub-goal Distillation: A Method to Improve Small Language Agents
par: Hashemzadeh, Maryam, et autres
Publié: (2024)
par: Hashemzadeh, Maryam, et autres
Publié: (2024)
Do Large Language Models Know How Much They Know?
par: Prato, Gabriele, et autres
Publié: (2025)
par: Prato, Gabriele, et autres
Publié: (2025)
Structure-Aligned Protein Language Model
par: Chen, Can, et autres
Publié: (2025)
par: Chen, Can, et autres
Publié: (2025)
Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models
par: Nilaksh, et autres
Publié: (2026)
par: Nilaksh, et autres
Publié: (2026)
The Expressive Limits of Diagonal SSMs for State-Tracking
par: Shakerinava, Mehran, et autres
Publié: (2026)
par: Shakerinava, Mehran, et autres
Publié: (2026)
Neural Coherence : Find higher performance to out-of-distribution tasks from few samples
par: Guiroy, Simon, et autres
Publié: (2025)
par: Guiroy, Simon, et autres
Publié: (2025)
BindGPT: A Scalable Framework for 3D Molecular Design via Language Modeling and Reinforcement Learning
par: Zholus, Artem, et autres
Publié: (2024)
par: Zholus, Artem, et autres
Publié: (2024)
Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models
par: Abbes, Istabrak, et autres
Publié: (2025)
par: Abbes, Istabrak, et autres
Publié: (2025)
CADmium: Fine-Tuning Code Language Models for Text-Driven Sequential CAD Design
par: Govindarajan, Prashant, et autres
Publié: (2025)
par: Govindarajan, Prashant, et autres
Publié: (2025)
Too Big to Fool: Resisting Deception in Language Models
par: Samsami, Mohammad Reza, et autres
Publié: (2024)
par: Samsami, Mohammad Reza, et autres
Publié: (2024)
Benchmarking Optimizers for Large Language Model Pretraining
par: Semenov, Andrei, et autres
Publié: (2025)
par: Semenov, Andrei, et autres
Publié: (2025)
Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing
par: Hashemzadeh, Maryam, et autres
Publié: (2026)
par: Hashemzadeh, Maryam, et autres
Publié: (2026)
Interpretability Needs a New Paradigm
par: Madsen, Andreas, et autres
Publié: (2024)
par: Madsen, Andreas, et autres
Publié: (2024)
Why Don't Prompt-Based Fairness Metrics Correlate?
par: Zayed, Abdelrahman, et autres
Publié: (2024)
par: Zayed, Abdelrahman, et autres
Publié: (2024)
Should We Attend More or Less? Modulating Attention for Fairness
par: Zayed, Abdelrahman, et autres
Publié: (2023)
par: Zayed, Abdelrahman, et autres
Publié: (2023)
Investigating the Multilingual Calibration Effects of Language Model Instruction-Tuning
par: Huang, Jerry, et autres
Publié: (2026)
par: Huang, Jerry, et autres
Publié: (2026)
Protein Fold Classification at Scale: Benchmarking and Pretraining
par: Chen, Dexiong, et autres
Publié: (2026)
par: Chen, Dexiong, et autres
Publié: (2026)
Shielded Controller Units for RL with Operational Constraints Applied to Remote Microgrids
par: Nekoei, Hadi, et autres
Publié: (2025)
par: Nekoei, Hadi, et autres
Publié: (2025)
Do Robot Snakes Dream like Electric Sheep? Investigating the Effects of Architectural Inductive Biases on Hallucination
par: Huang, Jerry, et autres
Publié: (2024)
par: Huang, Jerry, et autres
Publié: (2024)
General Protein Pretraining or Domain-Specific Designs? Benchmarking Protein Modeling on Realistic Applications
par: Yan, Shuo, et autres
Publié: (2025)
par: Yan, Shuo, et autres
Publié: (2025)
H2LooP Spark Preview: Continual Pretraining of Large Language Models for Low-Level Embedded Systems Code
par: Singh, Amit, et autres
Publié: (2026)
par: Singh, Amit, et autres
Publié: (2026)
Documents similaires
-
Manifold Metric: A Loss Landscape Approach for Predicting Model Performance
par: Malviya, Pranshu, et autres
Publié: (2024) -
Lookbehind-SAM: k steps back, 1 step forward
par: Mordido, Gonçalo, et autres
Publié: (2023) -
NovoMolGen: Rethinking Molecular Language Model Pretraining
par: Chitsaz, Kamran, et autres
Publié: (2025) -
Exploring Quantization for Efficient Pre-Training of Transformer Language Models
par: Chitsaz, Kamran, et autres
Publié: (2024) -
Intelligent Switching for Reset-Free RL
par: Patil, Darshan, et autres
Publié: (2024)