🎁В Твиттере появился довольно неплохой гайд по запуску локальных LLM — один знаток подробно https://carteakey.dev/blog/local-inference/local-llm-optimization/ [описал] все нюансы использования llama.cpp
Там есть все: текстовые рекомендации, полезные флаги для оптимизации: --fit on, --fit-ctx 65536, --fit-target 512 и другие полезности.
Магии не ждите, но выжать больше токенов в секунду из своего железа можно
😆 https://t.me/+q6SAUXqW4fYzMzhi [Доктор GPT]
Инструменты:
Хотите получать такое каждую неделю?