Y
HN Search
Hacker News Search
new
|
comments
|
top
|
jobs
ollamer
searching Neon…
1.
▲
2.
▲
3.
▲
4.
▲
5.
▲
6.
▲
19 ms
·
1.
▲
by
ollamer
2mo ago
https://github.com/ollama/ollama/issues/11772 A year and still no implementation for such a basic need as offloading MoE layers onto the CPU selectively. On llama.cpp I can get models like Qwen 35BA3B running