MIDUS: Memory-Infused Depth Up-Scaling
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Taero, Byun, Hoyoon, Choi, Youngjun, Park, Sungrae, Song, Kyungwoo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models
di: Byun, Hoyoon, et al.
Pubblicazione: (2025)
di: Byun, Hoyoon, et al.
Pubblicazione: (2025)
Perturb-and-Compare Approach for Detecting Out-of-Distribution Samples in Constrained Access Environments
di: Lee, Heeyoung, et al.
Pubblicazione: (2024)
di: Lee, Heeyoung, et al.
Pubblicazione: (2024)
Sufficient Invariant Learning for Distribution Shift
di: Kim, Taero, et al.
Pubblicazione: (2022)
di: Kim, Taero, et al.
Pubblicazione: (2022)
LBC: Language-Based-Classifier for Out-Of-Variable Generalization
di: Noh, Kangjun, et al.
Pubblicazione: (2024)
di: Noh, Kangjun, et al.
Pubblicazione: (2024)
Eigen-Value: Efficient Domain-Robust Data Valuation via Eigenvalue-Based Approach
di: Choi, Youngjun, et al.
Pubblicazione: (2025)
di: Choi, Youngjun, et al.
Pubblicazione: (2025)
Graph Perceiver IO: A General Architecture for Graph Structured Data
di: Bae, Seyun, et al.
Pubblicazione: (2022)
di: Bae, Seyun, et al.
Pubblicazione: (2022)
Spurious Correlation-Aware Embedding Regularization for Worst-Group Robustness
di: Park, Subeen, et al.
Pubblicazione: (2025)
di: Park, Subeen, et al.
Pubblicazione: (2025)
SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling
di: Kim, Dahyun, et al.
Pubblicazione: (2023)
di: Kim, Dahyun, et al.
Pubblicazione: (2023)
Multi-LLM Adaptive Conformal Inference for Reliable LLM Responses
di: Noh, Kangjun, et al.
Pubblicazione: (2026)
di: Noh, Kangjun, et al.
Pubblicazione: (2026)
Semi-Supervised Preference Optimization with Limited Feedback
di: Lee, Seonggyun, et al.
Pubblicazione: (2025)
di: Lee, Seonggyun, et al.
Pubblicazione: (2025)
Federated Learning for Face Recognition via Intra-subject Self-supervised Learning
di: Kim, Hansol, et al.
Pubblicazione: (2024)
di: Kim, Hansol, et al.
Pubblicazione: (2024)
Flat Posterior Does Matter For Bayesian Model Averaging
di: Lim, Sungjun, et al.
Pubblicazione: (2024)
di: Lim, Sungjun, et al.
Pubblicazione: (2024)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
di: Yoon, Deokgyu, et al.
Pubblicazione: (2026)
di: Yoon, Deokgyu, et al.
Pubblicazione: (2026)
Adaptive Task Vectors for Large Language Models
di: Kang, Joonseong, et al.
Pubblicazione: (2025)
di: Kang, Joonseong, et al.
Pubblicazione: (2025)
Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling
di: Rodkin, Ivan, et al.
Pubblicazione: (2025)
di: Rodkin, Ivan, et al.
Pubblicazione: (2025)
Symmetric Reinforcement Learning Loss for Robust Learning on Diverse Tasks and Model Scales
di: Byun, Ju-Seung, et al.
Pubblicazione: (2024)
di: Byun, Ju-Seung, et al.
Pubblicazione: (2024)
MemER: Scaling Up Memory for Robot Control via Experience Retrieval
di: Sridhar, Ajay, et al.
Pubblicazione: (2025)
di: Sridhar, Ajay, et al.
Pubblicazione: (2025)
Hierarchy Representation of Data in Machine Learnings
di: Yegang, Han, et al.
Pubblicazione: (2023)
di: Yegang, Han, et al.
Pubblicazione: (2023)
Uncertainty-driven Embedding Convolution
di: Lim, Sungjun, et al.
Pubblicazione: (2025)
di: Lim, Sungjun, et al.
Pubblicazione: (2025)
SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning
di: Lee, Hojoon, et al.
Pubblicazione: (2024)
di: Lee, Hojoon, et al.
Pubblicazione: (2024)
Scaling Up Bayesian DAG Sampling
di: Nikzad, Daniele, et al.
Pubblicazione: (2025)
di: Nikzad, Daniele, et al.
Pubblicazione: (2025)
Effective Test-Time Scaling of Discrete Diffusion through Iterative Refinement
di: Lee, Sanghyun, et al.
Pubblicazione: (2025)
di: Lee, Sanghyun, et al.
Pubblicazione: (2025)
Disentangling Disentangled Representations: Towards Improved Latent Units via Diffusion Models
di: Jun, Youngjun, et al.
Pubblicazione: (2024)
di: Jun, Youngjun, et al.
Pubblicazione: (2024)
Consistency-Guided Temperature Scaling Using Style and Content Information for Out-of-Domain Calibration
di: Choi, Wonjeong, et al.
Pubblicazione: (2024)
di: Choi, Wonjeong, et al.
Pubblicazione: (2024)
Scaling Up Data Parallelism in Decentralized Deep Learning
di: Xie, Bing, et al.
Pubblicazione: (2025)
di: Xie, Bing, et al.
Pubblicazione: (2025)
Position: AI Scaling: From Up to Down and Out
di: Wang, Yunke, et al.
Pubblicazione: (2025)
di: Wang, Yunke, et al.
Pubblicazione: (2025)
Scaling Up Probabilistic Circuits by Latent Variable Distillation
di: Liu, Anji, et al.
Pubblicazione: (2022)
di: Liu, Anji, et al.
Pubblicazione: (2022)
Synthetic Mixed Training: Scaling Parametric Knowledge Acquisition Beyond RAG
di: Han, Seungju, et al.
Pubblicazione: (2026)
di: Han, Seungju, et al.
Pubblicazione: (2026)
TimeMKG: Knowledge-Infused Causal Reasoning for Multivariate Time Series Modeling
di: Sun, Yifei, et al.
Pubblicazione: (2025)
di: Sun, Yifei, et al.
Pubblicazione: (2025)
CAMEL-CLIP: Channel-aware Multimodal Electroencephalography-text Alignment for Generalizable Brain Foundation Models
di: Choi, Hanseul, et al.
Pubblicazione: (2026)
di: Choi, Hanseul, et al.
Pubblicazione: (2026)
Possibility for Proactive Anomaly Detection
di: Jeon, Jinsung, et al.
Pubblicazione: (2025)
di: Jeon, Jinsung, et al.
Pubblicazione: (2025)
Addressing LLM Diversity by Infusing Random Concepts
di: Agrawal, Pulin, et al.
Pubblicazione: (2026)
di: Agrawal, Pulin, et al.
Pubblicazione: (2026)
DSLR: Diversity Enhancement and Structure Learning for Rehearsal-based Graph Continual Learning
di: Choi, Seungyoon, et al.
Pubblicazione: (2024)
di: Choi, Seungyoon, et al.
Pubblicazione: (2024)
Beyond the Pre-Service Horizon: Infusing In-Service Behavior for Improved Financial Risk Forecasting
di: Liu, Senhao, et al.
Pubblicazione: (2025)
di: Liu, Senhao, et al.
Pubblicazione: (2025)
Can TabPFN Compete with GNNs for Node Classification via Graph Tabularization?
di: Choi, Jeongwhan, et al.
Pubblicazione: (2025)
di: Choi, Jeongwhan, et al.
Pubblicazione: (2025)
ANCRe: Adaptive Neural Connection Reassignment for Efficient Depth Scaling
di: Zhang, Yilang, et al.
Pubblicazione: (2026)
di: Zhang, Yilang, et al.
Pubblicazione: (2026)
Towards Robust Real-World Multivariate Time Series Forecasting: A Unified Framework for Dependency, Asynchrony, and Missingness
di: Jang, Jinkwan, et al.
Pubblicazione: (2025)
di: Jang, Jinkwan, et al.
Pubblicazione: (2025)
Stability Analysis of Sharpness-Aware Minimization
di: Kim, Hoki, et al.
Pubblicazione: (2023)
di: Kim, Hoki, et al.
Pubblicazione: (2023)
DUEL: Duplicate Elimination on Active Memory for Self-Supervised Class-Imbalanced Learning
di: Choi, Won-Seok, et al.
Pubblicazione: (2024)
di: Choi, Won-Seok, et al.
Pubblicazione: (2024)
Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
di: Bian, Song, et al.
Pubblicazione: (2025)
di: Bian, Song, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models
di: Byun, Hoyoon, et al.
Pubblicazione: (2025) -
Perturb-and-Compare Approach for Detecting Out-of-Distribution Samples in Constrained Access Environments
di: Lee, Heeyoung, et al.
Pubblicazione: (2024) -
Sufficient Invariant Learning for Distribution Shift
di: Kim, Taero, et al.
Pubblicazione: (2022) -
LBC: Language-Based-Classifier for Out-Of-Variable Generalization
di: Noh, Kangjun, et al.
Pubblicazione: (2024) -
Eigen-Value: Efficient Domain-Robust Data Valuation via Eigenvalue-Based Approach
di: Choi, Youngjun, et al.
Pubblicazione: (2025)