6 ms·Recent Developments in LLM Architectures: KV Sharing, MHC, Compressed Attention3 points by pretext 4mo ago