Enregistré dans:
| Auteurs principaux: | Li, Shanda, You, Chong, Guruganesh, Guru, Ainslie, Joshua, Ontanon, Santiago, Zaheer, Manzil, Sanghai, Sumit, Yang, Yiming, Kumar, Sanjiv, Bhojanapalli, Srinadh |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2310.04418 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scalable In-context Ranking with Generative Models
par: Gupta, Nilesh, et autres
Publié: (2025)
par: Gupta, Nilesh, et autres
Publié: (2025)
Position Coupling: Improving Length Generalization of Arithmetic Transformers Using Task Structure
par: Cho, Hanseul, et autres
Publié: (2024)
par: Cho, Hanseul, et autres
Publié: (2024)
HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM Inference
par: L, Yashas Samaga B, et autres
Publié: (2024)
par: L, Yashas Samaga B, et autres
Publié: (2024)
On student-teacher deviations in distillation: does it pay to disobey?
par: Nagarajan, Vaishnavh, et autres
Publié: (2023)
par: Nagarajan, Vaishnavh, et autres
Publié: (2023)
Mimetic Initialization Helps State Space Models Learn to Recall
par: Trockman, Asher, et autres
Publié: (2024)
par: Trockman, Asher, et autres
Publié: (2024)
Arithmetic Transformers Can Length-Generalize in Both Operand Length and Count
par: Cho, Hanseul, et autres
Publié: (2024)
par: Cho, Hanseul, et autres
Publié: (2024)
Autoregressive Ranking: Bridging the Gap Between Dual and Cross Encoders
par: Rozonoyer, Benjamin, et autres
Publié: (2026)
par: Rozonoyer, Benjamin, et autres
Publié: (2026)
Differentially Private Model Merging
par: Yin, Qichuan, et autres
Publié: (2026)
par: Yin, Qichuan, et autres
Publié: (2026)
Efficient Language Model Architectures for Differentially Private Federated Learning
par: Ro, Jae Hun, et autres
Publié: (2024)
par: Ro, Jae Hun, et autres
Publié: (2024)
Dual-Encoders for Extreme Multi-Label Classification
par: Gupta, Nilesh, et autres
Publié: (2023)
par: Gupta, Nilesh, et autres
Publié: (2023)
Efficient Distributed Optimization under Heavy-Tailed Noise
par: Lee, Su Hyeong, et autres
Publié: (2025)
par: Lee, Su Hyeong, et autres
Publié: (2025)
A Statistical Framework for Data-dependent Retrieval-Augmented Models
par: Basu, Soumya, et autres
Publié: (2024)
par: Basu, Soumya, et autres
Publié: (2024)
Learning a Fourier Transform for Linear Relative Positional Encodings in Transformers
par: Choromanski, Krzysztof Marcin, et autres
Publié: (2023)
par: Choromanski, Krzysztof Marcin, et autres
Publié: (2023)
Federation over Text: Insight Sharing for Multi-Agent Reasoning
par: Yao, Dixi, et autres
Publié: (2026)
par: Yao, Dixi, et autres
Publié: (2026)
Spark Transformer: Reactivating Sparsity in FFN and Attention
par: You, Chong, et autres
Publié: (2025)
par: You, Chong, et autres
Publié: (2025)
Advances in Transformers for Robotic Applications: A Review
par: Sanghai, Nikunj, et autres
Publié: (2024)
par: Sanghai, Nikunj, et autres
Publié: (2024)
A Fresh Take on Stale Embeddings: Improving Dense Retriever Training with Corrector Networks
par: Monath, Nicholas, et autres
Publié: (2024)
par: Monath, Nicholas, et autres
Publié: (2024)
Efficient Adaptive Federated Optimization
par: Lee, Su Hyeong, et autres
Publié: (2024)
par: Lee, Su Hyeong, et autres
Publié: (2024)
Contracting with a Learning Agent
par: Guruganesh, Guru, et autres
Publié: (2024)
par: Guruganesh, Guru, et autres
Publié: (2024)
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
par: Huang, Yukun, et autres
Publié: (2025)
par: Huang, Yukun, et autres
Publié: (2025)
Maximal Update Parametrization and Zero-Shot Hyperparameter Transfer for Fourier Neural Operators
par: Li, Shanda, et autres
Publié: (2025)
par: Li, Shanda, et autres
Publié: (2025)
Adaptive Retrieval and Scalable Indexing for k-NN Search with Cross-Encoders
par: Yadav, Nishant, et autres
Publié: (2024)
par: Yadav, Nishant, et autres
Publié: (2024)
Integrating Planning into Single-Turn Long-Form Text Generation
par: Liang, Yi, et autres
Publié: (2024)
par: Liang, Yi, et autres
Publié: (2024)
Some Series Related to Extended Riemann Hypothesis for Dedekind Zeta Functions
par: Zaheer, Muhammad Atif
Publié: (2025)
par: Zaheer, Muhammad Atif
Publié: (2025)
Understanding Outer Optimizers in Local SGD: Learning Rates, Momentum, and Acceleration
par: Khaled, Ahmed, et autres
Publié: (2025)
par: Khaled, Ahmed, et autres
Publié: (2025)
ExeDec: Execution Decomposition for Compositional Generalization in Neural Program Synthesis
par: Shi, Kensen, et autres
Publié: (2023)
par: Shi, Kensen, et autres
Publié: (2023)
Asynchronous Heavy-Tailed Optimization
par: Sun, Junfei, et autres
Publié: (2026)
par: Sun, Junfei, et autres
Publié: (2026)
An Improved Collecting Bottle
par: Ainslie, C. N. (Charles Nicholas)
Publié: (1915)
par: Ainslie, C. N. (Charles Nicholas)
Publié: (1915)
HLA‐DPA1*01:228 is the First DPA1 Allele Described With an Alanine at Position 42 of Alpha‐1 Domain
par: Luis Alberto Marin Rubio, et autres
Publié: (2025)
par: Luis Alberto Marin Rubio, et autres
Publié: (2025)
HLA‐DRB1*08:130 Is the First DRB1 Allele Described With a Leucine at Position 64 of Beta‐1 Domain
par: Luis Alberto Marin Rubio, et autres
Publié: (2025)
par: Luis Alberto Marin Rubio, et autres
Publié: (2025)
CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization
par: Sun, Weiwei, et autres
Publié: (2025)
par: Sun, Weiwei, et autres
Publié: (2025)
Corpo e arte: uma proposta pedagógica na Educação Física a partir da bola de equilíbrio circense
par: Teresa Ontañón Barragán
Publié: (2019)
par: Teresa Ontañón Barragán
Publié: (2019)
APRENDENDO A ENSINAR CIRCO: A CURRICULARIZAÇÃO DA EXTENSÃO UNIVERSITÁRIA E SEUS IMPACTOS NA FORMAÇÃO DOS DISCENTES
par: Teresa Ontañón Barragán
Publié: (2023)
par: Teresa Ontañón Barragán
Publié: (2023)
CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs
par: Mireshghallah, Niloofar, et autres
Publié: (2025)
par: Mireshghallah, Niloofar, et autres
Publié: (2025)
Analysis of Plan-based Retrieval for Grounded Text Generation
par: Godbole, Ameya, et autres
Publié: (2024)
par: Godbole, Ameya, et autres
Publié: (2024)
Deep Reinforcement Learning for Sequential Combinatorial Auctions
par: Ravindranath, Sai Srivatsa, et autres
Publié: (2024)
par: Ravindranath, Sai Srivatsa, et autres
Publié: (2024)
kylieainslie/mitey: mitey 0.3.1
par: Kylie Ainslie
Publié: (2026)
par: Kylie Ainslie
Publié: (2026)
India : historia del subcontinente desde las culturas del indo hasta el comienzo del dominio inglés / Ainslie T. Embree y Friedrich Wilhelm; traductores Antón Dieterich, María Isabel Carrillo
par: Embree, Ainslie
par: Embree, Ainslie
Inadequate housing is not neglect: How the family regulation system punishes parents for a housing crisis out of their control
par: Ainslie Martin
Publié: (2025)
par: Ainslie Martin
Publié: (2025)
La enfermedad meningocócica en España, 1990-1997. Cambio en su patrón epidemiológico
par: Salvador de Mateo Ontañón
Publié: (2000)
par: Salvador de Mateo Ontañón
Publié: (2000)
Documents similaires
-
Scalable In-context Ranking with Generative Models
par: Gupta, Nilesh, et autres
Publié: (2025) -
Position Coupling: Improving Length Generalization of Arithmetic Transformers Using Task Structure
par: Cho, Hanseul, et autres
Publié: (2024) -
HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM Inference
par: L, Yashas Samaga B, et autres
Publié: (2024) -
On student-teacher deviations in distillation: does it pay to disobey?
par: Nagarajan, Vaishnavh, et autres
Publié: (2023) -
Mimetic Initialization Helps State Space Models Learn to Recall
par: Trockman, Asher, et autres
Publié: (2024)