Você já deve ter vivido isso. Acha um modelo novo no Hugging Face, baixa 15, 20 GB, espera o download inteiro, roda o comando de start, e o modelo trava a 2 tokens por segundo. Ou pior, nem carrega, e a memória estoura antes da primeira resposta sair.
Isso não é falha sua. É que rodar IA local sempre dependeu de adivinhação. Você olha "7B", "13B", "70B" no nome do modelo e assume que vai funcionar, sem ter como saber de verdade até já ter gasto o tempo do download.
O problema nunca foi o modelo nem o hardware. Foi a distância entre o que um modelo precisa e o que sua máquina tem.
O que é o llmfit
O llmfit é uma ferramenta de terminal, open-source, escrita em Rust, criada por Alex Jones. Ela faz uma pergunta só, só que faz ela direito: qual desses modelos realmente roda bem na sua máquina.
Rodando localmente, ela detecta RAM, núcleos de CPU e VRAM da GPU (incluindo múltiplas GPUs, Apple Silicon com memória unificada, AMD via ROCm, Intel Arc), cruza esses números contra um banco com centenas de modelos de dezenas de provedores, e devolve um ranking. Cada modelo recebe uma pontuação combinando quatro critérios: qualidade esperada, velocidade estimada em tokens por segundo, o quanto ele cabe direito na sua memória, e o contexto máximo que sua máquina aguenta sem começar a trocar dado com o disco.
Nada disso passa pela internet. O banco de modelos já vem embutido no binário, então a ferramenta responde na hora, sem esperar nenhuma chamada externa.
Por que isso é mais interessante do que parece
A parte que chama atenção não é só "detectar hardware", ferramenta de benchmark faz isso há anos. É como ela lida com quantização. Em vez de assumir que você quer rodar em Q4 ou Q8, o llmfit calcula o requisito de memória em toda a escada de quantização, de Q8_0 até Q2_K, e escolhe a melhor opção que ainda cabe no que você tem disponível.
O ponto que mais aparece nos relatos de quem já testou é como ela trata modelos de arquitetura MoE (mixture of experts, onde só uma parte dos parâmetros fica ativa por vez). A maioria das ferramentas de estimativa trata todo modelo como denso e calcula memória em cima do total de parâmetros, o que penaliza um MoE injustamente. O llmfit reconhece essa arquitetura e ajusta o cálculo, então um modelo desse tipo aparece com uma pontuação de fit mais próxima da realidade.
Ela também já integra direto com Ollama e llama.cpp. Depois de achar o modelo certo, dá pra baixar sem sair do terminal.
Um caso real de uso
Quem testou a ferramenta num notebook de 2019, com 8GB de RAM e sem GPU dedicada, recebeu como recomendação o Phi-mini-MoE-instruct, com pontuação de 90 em 100, e estimativa de 40 tokens por segundo. Rodando de fato, a velocidade ficou um pouco abaixo do previsto, mas ainda numa faixa perfeitamente usável. Numa máquina modesta, sem nenhum ajuste manual, a ferramenta acertou o modelo certo de cara.
O setor anda rápido demais pra qualquer lista parar no tempo
O setor de IA lança modelo novo praticamente toda semana, e um banco fixo, por mais completo que seja, corre atrás disso o tempo todo. É o preço de qualquer catálogo nesse ritmo. A comunidade em volta do llmfit já reagiu a isso: surgiu um fork chamado "Cookbook", com curadoria atualizada com mais frequência, pensado justamente pra acompanhar o lançamento constante de modelo novo sem depender só do ciclo de versão da ferramenta original.
É o tipo de sinal que costuma aparecer em ferramenta open-source que pegou tração de verdade. Nasce resolvendo um problema específico, ganha comunidade em volta, e a comunidade começa a esticar o que a ferramenta original faz.
Pra quem está começando a migrar de IA na nuvem pra IA local, ter uma ferramenta que aponta o caminho antes do primeiro download já resolve a maior fonte de frustração dessa fase.
Quem quiser testar, o llmfit é open-source e gratuito. O código está no GitHub: github.com/AlexsJones/llmfit















Comentários (0)
Os comentários são moderados e caso viole nossos Termos e Condições de uso, o comentário será excluído. A persistência na violação acarretará em um banimento da sua conta.