TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization
arXiv:2606.13054v2 Announce Type: replace-cross Abstract: Large language models (LLMs) exhibit exceptional general language processing capabilities, but their memory and compute…
