Quecto-V1: Empirical Analysis of 8-bit Quantized Small Language Models for On-Device Legal Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Dikshit, Subrit |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Patient-Doctor-NLP-System to contest inequality for less privileged
par: Dikshit, Subrit, et autres
Publié: (2025)
par: Dikshit, Subrit, et autres
Publié: (2025)
Multilingual Machine Translation with Quantum Encoder Decoder Attention-based Convolutional Variational Circuits
par: Dikshit, Subrit, et autres
Publié: (2025)
par: Dikshit, Subrit, et autres
Publié: (2025)
1bit-Merging: Dynamic Quantized Merging for Large Language Models
par: Liu, Shuqi, et autres
Publié: (2025)
par: Liu, Shuqi, et autres
Publié: (2025)
Can Small Language Models Use What They Retrieve? An Empirical Study of Retrieval Utilization Across Model Scale
par: Pandey, Sanchit
Publié: (2026)
par: Pandey, Sanchit
Publié: (2026)
LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models
par: Li, Tianchun, et autres
Publié: (2026)
par: Li, Tianchun, et autres
Publié: (2026)
The Impact of Quantization on Retrieval-Augmented Generation: An Analysis of Small LLMs
par: Yazan, Mert, et autres
Publié: (2024)
par: Yazan, Mert, et autres
Publié: (2024)
BitNet a4.8: 4-bit Activations for 1-bit LLMs
par: Wang, Hongyu, et autres
Publié: (2024)
par: Wang, Hongyu, et autres
Publié: (2024)
CLERC: A Dataset for Legal Case Retrieval and Retrieval-Augmented Analysis Generation
par: Hou, Abe Bohan, et autres
Publié: (2024)
par: Hou, Abe Bohan, et autres
Publié: (2024)
Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
par: Liu, Ruikang, et autres
Publié: (2025)
par: Liu, Ruikang, et autres
Publié: (2025)
Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models
par: Tu, Zhijun, et autres
Publié: (2025)
par: Tu, Zhijun, et autres
Publié: (2025)
Athena: Retrieval-augmented Legal Judgment Prediction with Large Language Models
par: Peng, Xiao, et autres
Publié: (2024)
par: Peng, Xiao, et autres
Publié: (2024)
SlimLM: An Efficient Small Language Model for On-Device Document Assistance
par: Pham, Thang M., et autres
Publié: (2024)
par: Pham, Thang M., et autres
Publié: (2024)
Unlocking Data-free Low-bit Quantization with Matrix Decomposition for KV Cache Compression
par: Liu, Peiyu, et autres
Publié: (2024)
par: Liu, Peiyu, et autres
Publié: (2024)
Legal-DC: Benchmarking Retrieval-Augmented Generation for Legal Documents
par: Li, Yaocong, et autres
Publié: (2026)
par: Li, Yaocong, et autres
Publié: (2026)
When are 1.58 bits enough? A Bottom-up Exploration of BitNet Quantization
par: Nielsen, Jacob, et autres
Publié: (2024)
par: Nielsen, Jacob, et autres
Publié: (2024)
Fast and Slow Generating: An Empirical Study on Large and Small Language Models Collaborative Decoding
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models
par: Feng, Yuming, et autres
Publié: (2026)
par: Feng, Yuming, et autres
Publié: (2026)
OneBit: Towards Extremely Low-bit Large Language Models
par: Xu, Yuzhuang, et autres
Publié: (2024)
par: Xu, Yuzhuang, et autres
Publié: (2024)
AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
par: IslamBouli, Beshr, et autres
Publié: (2026)
par: IslamBouli, Beshr, et autres
Publié: (2026)
The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits
par: Ma, Shuming, et autres
Publié: (2024)
par: Ma, Shuming, et autres
Publié: (2024)
Enhancing Legal Document Retrieval: A Multi-Phase Approach with Large Language Models
par: Nguyen, Hai-Long, et autres
Publié: (2024)
par: Nguyen, Hai-Long, et autres
Publié: (2024)
Bielik-Q2-Sharp: A Comparative Study of Extreme 2-bit Quantization Methods for a Polish 11B Language Model
par: Prejzner, Jakub
Publié: (2026)
par: Prejzner, Jakub
Publié: (2026)
Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations
par: Blumenberg, Patrick, et autres
Publié: (2025)
par: Blumenberg, Patrick, et autres
Publié: (2025)
LegalSearchLM: Rethinking Legal Case Retrieval as Legal Elements Generation
par: Kim, Chaeeun, et autres
Publié: (2025)
par: Kim, Chaeeun, et autres
Publié: (2025)
MEL: Legal Spanish Language Model
par: Sánchez, David Betancur, et autres
Publié: (2025)
par: Sánchez, David Betancur, et autres
Publié: (2025)
Large Language Models as Foundations for Next-Gen Dense Retrieval: A Comprehensive Empirical Assessment
par: Luo, Kun, et autres
Publié: (2024)
par: Luo, Kun, et autres
Publié: (2024)
Large Language Models as Universal Predictors? An Empirical Study on Small Tabular Datasets
par: Pavlidis, Nikolaos, et autres
Publié: (2025)
par: Pavlidis, Nikolaos, et autres
Publié: (2025)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
par: Liu, Zirui, et autres
Publié: (2024)
par: Liu, Zirui, et autres
Publié: (2024)
A Reasoning-Focused Legal Retrieval Benchmark
par: Zheng, Lucia, et autres
Publié: (2025)
par: Zheng, Lucia, et autres
Publié: (2025)
ASVRI-Legal: Fine-Tuning LLMs with Retrieval Augmented Generation for Enhanced Legal Regulation
par: Octadion, One, et autres
Publié: (2025)
par: Octadion, One, et autres
Publié: (2025)
Assessing the Performance Gap Between Lexical and Semantic Models for Information Retrieval With Formulaic Legal Language
par: Mori, Larissa, et autres
Publié: (2025)
par: Mori, Larissa, et autres
Publié: (2025)
Reformulating Domain Adaptation of Large Language Models as Adapt-Retrieve-Revise: A Case Study on Chinese Legal Domain
par: wan, Zhen, et autres
Publié: (2023)
par: wan, Zhen, et autres
Publié: (2023)
Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis
par: Zhou, Jie, et autres
Publié: (2025)
par: Zhou, Jie, et autres
Publié: (2025)
Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis
par: Zhu, Wenhao, et autres
Publié: (2023)
par: Zhu, Wenhao, et autres
Publié: (2023)
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
par: Xie, Qiujie, et autres
Publié: (2025)
par: Xie, Qiujie, et autres
Publié: (2025)
An Empirical Analysis on Large Language Models in Debate Evaluation
par: Liu, Xinyi, et autres
Publié: (2024)
par: Liu, Xinyi, et autres
Publié: (2024)
LRAGE: Legal Retrieval Augmented Generation Evaluation Tool
par: Park, Minhu, et autres
Publié: (2025)
par: Park, Minhu, et autres
Publié: (2025)
Retrieval Augmented Generation-based Large Language Models for Bridging Transportation Cybersecurity Legal Knowledge Gaps
par: Akbar, Khandakar Ashrafi, et autres
Publié: (2025)
par: Akbar, Khandakar Ashrafi, et autres
Publié: (2025)
Retrieve, Generate, Evaluate: A Case Study for Medical Paraphrases Generation with Small Language Models
par: Buhnila, Ioana, et autres
Publié: (2024)
par: Buhnila, Ioana, et autres
Publié: (2024)
Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models
par: Dahl, Matthew, et autres
Publié: (2024)
par: Dahl, Matthew, et autres
Publié: (2024)
Documents similaires
-
A Patient-Doctor-NLP-System to contest inequality for less privileged
par: Dikshit, Subrit, et autres
Publié: (2025) -
Multilingual Machine Translation with Quantum Encoder Decoder Attention-based Convolutional Variational Circuits
par: Dikshit, Subrit, et autres
Publié: (2025) -
1bit-Merging: Dynamic Quantized Merging for Large Language Models
par: Liu, Shuqi, et autres
Publié: (2025) -
Can Small Language Models Use What They Retrieve? An Empirical Study of Retrieval Utilization Across Model Scale
par: Pandey, Sanchit
Publié: (2026) -
LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models
par: Li, Tianchun, et autres
Publié: (2026)