DNCs Require More Planning Steps
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shamshoum, Yara, Hodos, Nitzan, Sieradzki, Yuval, Schuster, Assaf |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
QKV Projections Require a Fraction of Their Memory
par: Khalaf, Malik, et autres
Publié: (2025)
par: Khalaf, Malik, et autres
Publié: (2025)
CompAct: Compressed Activations for Memory-Efficient LLM Training
par: Shamshoum, Yara, et autres
Publié: (2024)
par: Shamshoum, Yara, et autres
Publié: (2024)
Modified Adaptive Tree-Structured Parzen Estimator for Hyperparameter Optimization
par: Sieradzki, Szymon, et autres
Publié: (2025)
par: Sieradzki, Szymon, et autres
Publié: (2025)
FOSI: Hybrid First and Second Order Optimization
par: Sivan, Hadar, et autres
Publié: (2023)
par: Sivan, Hadar, et autres
Publié: (2023)
R2VF: A Two-Step Regularization Algorithm to Cluster Categories in GLMs
par: Dror, Yuval Ben
Publié: (2025)
par: Dror, Yuval Ben
Publié: (2025)
Position: Understanding LLMs Requires More Than Statistical Generalization
par: Reizinger, Patrik, et autres
Publié: (2024)
par: Reizinger, Patrik, et autres
Publié: (2024)
More Test-Time Compute Can Hurt: Overestimation Bias in LLM Beam Search
par: Dalal, Gal, et autres
Publié: (2026)
par: Dalal, Gal, et autres
Publié: (2026)
Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives
par: Schwinn, Leo, et autres
Publié: (2025)
par: Schwinn, Leo, et autres
Publié: (2025)
Who Said Neural Networks Aren't Linear?
par: Berman, Nimrod, et autres
Publié: (2025)
par: Berman, Nimrod, et autres
Publié: (2025)
DMS: Addressing Information Loss with More Steps for Pragmatic Adversarial Attacks
par: Zhu, Zhiyu, et autres
Publié: (2024)
par: Zhu, Zhiyu, et autres
Publié: (2024)
Facial Misrecognition Systems: Simple Weight Manipulations Force DNNs to Err Only on Specific Persons
par: Zehavi, Irad, et autres
Publié: (2023)
par: Zehavi, Irad, et autres
Publié: (2023)
Let's do the time-warp-attend: Learning topological invariants of dynamical systems
par: Moriel, Noa, et autres
Publié: (2023)
par: Moriel, Noa, et autres
Publié: (2023)
LinkLogic: A New Method and Benchmark for Explainable Knowledge Graph Predictions
par: Kumar-Singh, Niraj, et autres
Publié: (2024)
par: Kumar-Singh, Niraj, et autres
Publié: (2024)
Large Language Models for Water Distribution Systems Modeling and Decision-Making
par: Goldshtein, Yinon, et autres
Publié: (2025)
par: Goldshtein, Yinon, et autres
Publié: (2025)
MUON+: Towards More Effective Muon via One Additional Normalization Step for LLM Pre-training
par: Zhang, Ruijie, et autres
Publié: (2026)
par: Zhang, Ruijie, et autres
Publié: (2026)
Attention Sinks Are Provably Necessary in Softmax Transformers: Evidence from Trigger-Conditional Tasks
par: Ran-Milo, Yuval
Publié: (2026)
par: Ran-Milo, Yuval
Publié: (2026)
Opinion: Learning Intuitive Physics May Require More than Visual Data
par: Su, Ellen, et autres
Publié: (2025)
par: Su, Ellen, et autres
Publié: (2025)
On Prediction-Modelers and Decision-Makers: Why Fairness Requires More Than a Fair Prediction Model
par: Scantamburlo, Teresa, et autres
Publié: (2023)
par: Scantamburlo, Teresa, et autres
Publié: (2023)
Self-Evaluation Unlocks Any-Step Text-to-Image Generation
par: Yu, Xin, et autres
Publié: (2025)
par: Yu, Xin, et autres
Publié: (2025)
Can sparse autoencoders make sense of gene expression latent variable models?
par: Schuster, Viktoria
Publié: (2024)
par: Schuster, Viktoria
Publié: (2024)
Upper Counterfactual Confidence Bounds: a New Optimism Principle for Contextual Bandits
par: Xu, Yunbei, et autres
Publié: (2020)
par: Xu, Yunbei, et autres
Publié: (2020)
Temporal Context Awareness: A Defense Framework Against Multi-turn Manipulation Attacks on Large Language Models
par: Kulkarni, Prashant, et autres
Publié: (2025)
par: Kulkarni, Prashant, et autres
Publié: (2025)
Learning More Expressive General Policies for Classical Planning Domains
par: Ståhlberg, Simon, et autres
Publié: (2024)
par: Ståhlberg, Simon, et autres
Publié: (2024)
The Cost of Learning under Multiple Change Points
par: Gafni, Tomer, et autres
Publié: (2026)
par: Gafni, Tomer, et autres
Publié: (2026)
Symbolic Regression as Feature Engineering Method for Machine and Deep Learning Regression Tasks
par: Shmuel, Assaf, et autres
Publié: (2023)
par: Shmuel, Assaf, et autres
Publié: (2023)
Learning the Pareto Front Using Bootstrapped Observation Samples
par: Kim, Wonyoung, et autres
Publié: (2023)
par: Kim, Wonyoung, et autres
Publié: (2023)
Data Augmentation for Deep Learning Regression Tasks by Machine Learning Models
par: Shmuel, Assaf, et autres
Publié: (2025)
par: Shmuel, Assaf, et autres
Publié: (2025)
A Broader View of Thompson Sampling
par: Qu, Yanlin, et autres
Publié: (2025)
par: Qu, Yanlin, et autres
Publié: (2025)
How Do the Architecture and Optimizer Affect Representation Learning? On the Training Dynamics of Representations in Deep Neural Networks
par: Sharon, Yuval, et autres
Publié: (2024)
par: Sharon, Yuval, et autres
Publié: (2024)
Class Distribution Shifts in Zero-Shot Learning: Learning Robust Representations
par: Slavutsky, Yuli, et autres
Publié: (2023)
par: Slavutsky, Yuli, et autres
Publié: (2023)
CardiCat: a Variational Autoencoder for High-Cardinality Tabular Data
par: Carlin, Lee, et autres
Publié: (2025)
par: Carlin, Lee, et autres
Publié: (2025)
Enhancing Swarms Durability to Threats via Graph Signal Processing and GNN-based Generative Modeling
par: Karin, Jonathan, et autres
Publié: (2025)
par: Karin, Jonathan, et autres
Publié: (2025)
Nonparametric logistic regression with deep learning
par: Yara, Atsutomo, et autres
Publié: (2024)
par: Yara, Atsutomo, et autres
Publié: (2024)
A Theory of Nonparametric Covariance Function Estimation for Discretely Observed Data
par: Terada, Yoshikazu, et autres
Publié: (2026)
par: Terada, Yoshikazu, et autres
Publié: (2026)
Temporal Contrastive Transformer for Financial Crime Detection: Self-Supervised Sequence Embeddings via Predictive Contrastive Coding
par: Butvinik, Danny, et autres
Publié: (2026)
par: Butvinik, Danny, et autres
Publié: (2026)
Nearly Solved? Robust Deepfake Detection Requires More than Visual Forensics
par: Levy, Guy, et autres
Publié: (2024)
par: Levy, Guy, et autres
Publié: (2024)
AutoLoop: Fast Visual SLAM Fine-tuning through Agentic Curriculum Learning
par: Lahiany, Assaf, et autres
Publié: (2025)
par: Lahiany, Assaf, et autres
Publié: (2025)
Tight Robustness Certification Through the Convex Hull of $\ell_0$ Attacks
par: Shapira, Yuval, et autres
Publié: (2025)
par: Shapira, Yuval, et autres
Publié: (2025)
Why Self-Supervised Encoders Want to Be Normal
par: Domb, Yuval
Publié: (2026)
par: Domb, Yuval
Publié: (2026)
Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families
par: Levental, Yuval
Publié: (2026)
par: Levental, Yuval
Publié: (2026)
Documents similaires
-
QKV Projections Require a Fraction of Their Memory
par: Khalaf, Malik, et autres
Publié: (2025) -
CompAct: Compressed Activations for Memory-Efficient LLM Training
par: Shamshoum, Yara, et autres
Publié: (2024) -
Modified Adaptive Tree-Structured Parzen Estimator for Hyperparameter Optimization
par: Sieradzki, Szymon, et autres
Publié: (2025) -
FOSI: Hybrid First and Second Order Optimization
par: Sivan, Hadar, et autres
Publié: (2023) -
R2VF: A Two-Step Regularization Algorithm to Cluster Categories in GLMs
par: Dror, Yuval Ben
Publié: (2025)