Salvato in:
| Autori principali: | Jawahar, Ganesh, Yang, Haichuan, Xiong, Yunyang, Liu, Zechun, Wang, Dilin, Sun, Fei, Li, Meng, Pappu, Aasish, Oguz, Barlas, Abdul-Mageed, Muhammad, Lakshmanan, Laks V. S., Krishnamoorthi, Raghuraman, Chandra, Vikas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2306.04845 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLM Performance Predictors are good initializers for Architecture Search
di: Jawahar, Ganesh, et al.
Pubblicazione: (2023)
di: Jawahar, Ganesh, et al.
Pubblicazione: (2023)
MobileMoE: Scaling On-Device Mixture of Experts
di: Chen, Yanbei, et al.
Pubblicazione: (2026)
di: Chen, Yanbei, et al.
Pubblicazione: (2026)
PathFusion: Path-consistent Lidar-Camera Deep Feature Fusion
di: Wu, Lemeng, et al.
Pubblicazione: (2022)
di: Wu, Lemeng, et al.
Pubblicazione: (2022)
Multi-agent Architecture Search via Agentic Supernet
di: Zhang, Guibin, et al.
Pubblicazione: (2025)
di: Zhang, Guibin, et al.
Pubblicazione: (2025)
Autoregressive + Chain of Thought = Recurrent: Recurrence's Role in Language Models' Computability and a Revisit of Recurrent Transformer
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
Post-training an LLM for RAG? Train on Self-Generated Demonstrations
di: Finlayson, Matthew, et al.
Pubblicazione: (2025)
di: Finlayson, Matthew, et al.
Pubblicazione: (2025)
Subnet-Aware Dynamic Supernet Training for Neural Architecture Search
di: Jeon, Jeimin, et al.
Pubblicazione: (2025)
di: Jeon, Jeimin, et al.
Pubblicazione: (2025)
On Supernet Transfer Learning for Effective Task Adaptation
di: Singh, Prabhant, et al.
Pubblicazione: (2024)
di: Singh, Prabhant, et al.
Pubblicazione: (2024)
DetoxLLM: A Framework for Detoxification with Explanations
di: Khondaker, Md Tawkat Islam, et al.
Pubblicazione: (2024)
di: Khondaker, Md Tawkat Islam, et al.
Pubblicazione: (2024)
Fast Data Aware Neural Architecture Search via Supernet Accelerated Evaluation
di: Njor, Emil, et al.
Pubblicazione: (2025)
di: Njor, Emil, et al.
Pubblicazione: (2025)
Progressive Supernet Training for Efficient Visual Autoregressive Modeling
di: Chen, Xiaoyue, et al.
Pubblicazione: (2025)
di: Chen, Xiaoyue, et al.
Pubblicazione: (2025)
MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases
di: Liu, Zechun, et al.
Pubblicazione: (2024)
di: Liu, Zechun, et al.
Pubblicazione: (2024)
Efficient Supernet Training with Orthogonal Softmax for Scalable ASR Model Compression
di: Xu, Jingjing, et al.
Pubblicazione: (2025)
di: Xu, Jingjing, et al.
Pubblicazione: (2025)
DepthShrinker: A New Compression Paradigm Towards Boosting Real-Hardware Efficiency of Compact Neural Networks
di: Fu, Yonggan, et al.
Pubblicazione: (2022)
di: Fu, Yonggan, et al.
Pubblicazione: (2022)
SpinQuant: LLM quantization with learned rotations
di: Liu, Zechun, et al.
Pubblicazione: (2024)
di: Liu, Zechun, et al.
Pubblicazione: (2024)
MedNNS: Supernet-based Medical Task-Adaptive Neural Network Search
di: Mecharbat, Lotfi Abdelkrim, et al.
Pubblicazione: (2025)
di: Mecharbat, Lotfi Abdelkrim, et al.
Pubblicazione: (2025)
SqueezeSAM: User friendly mobile interactive segmentation
di: Varadarajan, Balakrishnan, et al.
Pubblicazione: (2023)
di: Varadarajan, Balakrishnan, et al.
Pubblicazione: (2023)
Efficient Track Anything
di: Xiong, Yunyang, et al.
Pubblicazione: (2024)
di: Xiong, Yunyang, et al.
Pubblicazione: (2024)
Agent-as-a-Judge: Evaluate Agents with Agents
di: Zhuge, Mingchen, et al.
Pubblicazione: (2024)
di: Zhuge, Mingchen, et al.
Pubblicazione: (2024)
PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning
di: Feng, Yushi, et al.
Pubblicazione: (2025)
di: Feng, Yushi, et al.
Pubblicazione: (2025)
SuperTickets: Drawing Task-Agnostic Lottery Tickets from Supernets via Jointly Architecture Searching and Parameter Pruning
di: You, Haoran, et al.
Pubblicazione: (2022)
di: You, Haoran, et al.
Pubblicazione: (2022)
Mixed-precision Supernet Training from Vision Foundation Models using Low Rank Adapter
di: Sakuma, Yuiko, et al.
Pubblicazione: (2024)
di: Sakuma, Yuiko, et al.
Pubblicazione: (2024)
DeepFedNAS: Efficient Hardware-Aware Architecture Adaptation for Heterogeneous IoT Federations via Pareto-Guided Supernet Training
di: Khan, Bostan, et al.
Pubblicazione: (2026)
di: Khan, Bostan, et al.
Pubblicazione: (2026)
AdaS&S: a One-Shot Supernet Approach for Automatic Embedding Size Search in Deep Recommender System
di: Wei, He, et al.
Pubblicazione: (2024)
di: Wei, He, et al.
Pubblicazione: (2024)
Routing-Free Mixture-of-Experts
di: Liu, Yilun, et al.
Pubblicazione: (2026)
di: Liu, Yilun, et al.
Pubblicazione: (2026)
Multilingual Routing in Mixture-of-Experts
di: Bandarkar, Lucas, et al.
Pubblicazione: (2025)
di: Bandarkar, Lucas, et al.
Pubblicazione: (2025)
MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
di: Zhao, Changsheng, et al.
Pubblicazione: (2025)
di: Zhao, Changsheng, et al.
Pubblicazione: (2025)
Exploring Expert Specialization through Unsupervised Training in Sparse Mixture of Experts
di: Nikolic, Strahinja, et al.
Pubblicazione: (2025)
di: Nikolic, Strahinja, et al.
Pubblicazione: (2025)
Efficient Universal Perception Encoder
di: Zhu, Chenchen, et al.
Pubblicazione: (2026)
di: Zhu, Chenchen, et al.
Pubblicazione: (2026)
Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation
di: Dalaq, Alaa, et al.
Pubblicazione: (2026)
di: Dalaq, Alaa, et al.
Pubblicazione: (2026)
KRAFT: A Knowledge Graph-Based Framework for Automated Map Conflation
di: Hashemi, Farnoosh, et al.
Pubblicazione: (2025)
di: Hashemi, Farnoosh, et al.
Pubblicazione: (2025)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
di: Liu, Zechun, et al.
Pubblicazione: (2025)
di: Liu, Zechun, et al.
Pubblicazione: (2025)
Small Vision-Language Models are Smart Compressors for Long Video Understanding
di: Fei, Junjie, et al.
Pubblicazione: (2026)
di: Fei, Junjie, et al.
Pubblicazione: (2026)
EdgeTAM: On-Device Track Anything Model
di: Zhou, Chong, et al.
Pubblicazione: (2025)
di: Zhou, Chong, et al.
Pubblicazione: (2025)
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
di: Gu, Zijin, et al.
Pubblicazione: (2025)
di: Gu, Zijin, et al.
Pubblicazione: (2025)
Maximum Score Routing For Mixture-of-Experts
di: Dong, Bowen, et al.
Pubblicazione: (2025)
di: Dong, Bowen, et al.
Pubblicazione: (2025)
Cross-Modal Consistency in Multimodal Large Language Models
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs
di: Xu, Zhiyuan, et al.
Pubblicazione: (2026)
di: Xu, Zhiyuan, et al.
Pubblicazione: (2026)
Geometric Routing Enables Causal Expert Control in Mixture of Experts
di: Ternovtsii, Ivan, et al.
Pubblicazione: (2026)
di: Ternovtsii, Ivan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LLM Performance Predictors are good initializers for Architecture Search
di: Jawahar, Ganesh, et al.
Pubblicazione: (2023) -
MobileMoE: Scaling On-Device Mixture of Experts
di: Chen, Yanbei, et al.
Pubblicazione: (2026) -
PathFusion: Path-consistent Lidar-Camera Deep Feature Fusion
di: Wu, Lemeng, et al.
Pubblicazione: (2022) -
Multi-agent Architecture Search via Agentic Supernet
di: Zhang, Guibin, et al.
Pubblicazione: (2025) -
Autoregressive + Chain of Thought = Recurrent: Recurrence's Role in Language Models' Computability and a Revisit of Recurrent Transformer
di: Zhang, Xiang, et al.
Pubblicazione: (2024)