O Kimi K3 (Moonshot AI) chegou empatando com o Opus 4.8 no índice de inteligência e custando ~70% menos. Aqui vai o caminho das pedras pra começar a usar hoje — do jeito grátis ao jeito de dev.
Os nomes de modelo e endpoints mudam a cada versão. Antes de colar em produção, confira o
id exato do modeloe abase URLno painel da Moonshot (platform.moonshot.ai).
- Acesse kimi.com - Faça login (Google ou e-mail)
- Deixe o modo thinking ligado — é onde o K3 brilha em raciocínio - Cole seu prompt. Ele aceita 1 milhão de tokens de contexto— pode jogar um PDF inteiro, um repositório ou uma transcrição longa
Dica: pra tarefa longa (código, análise de documento), comece o prompt dizendo o formato de saída que você quer. O K3 segue instrução de formato muito bem.
Preço no lançamento: $3 / milhão de tokens (input) e $15 / milhão (output) — contra $10/$50 do Fable 5.
A API da Moonshot é compatível com o formato da OpenAI, então dá pra plugar no SDK que você já usa só trocando base_url
e model
:
from openai import OpenAI
client = OpenAI(
api_key="SUA_CHAVE_MOONSHOT",
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3", # confira o id exato no painel
messages=[{"role": "user", "content": "Resuma este contrato:"}],
)
print(resp.choices[0].message.content)
Pega a chave em platform.moonshot.ai → API Keys.
Como a API é OpenAI-compatible, o K3 entra na maioria das ferramentas de código:
Cline / Roo (VS Code): adicione um provider "OpenAI Compatible", base URLhttps://api.moonshot.ai/v1
, modelokimi-k3
Aider:aider --model openai/kimi-k3
com as env varsOPENAI_API_BASE
eOPENAI_API_KEY
apontando pra MoonshotQualquer app que fale "OpenAI API": mesma troca de base_url + modelo
O 1M de contexto faz diferença real aqui: dá pra mandar o projeto inteiro sem picotar.
O K3 tem pesos abertos (2.8T de parâmetros). Não dá pra rodar num notebook, mas:
- Baixe os pesos no
Hugging Face(procure por
moonshotai / Kimi-K3
) - Sirva com vLLM ouSGLang num servidor com GPU - Zero custo por token, zero lock-in — você é dono da inferência
Se não tem GPU parruda, use um provider de inferência open (Together, Fireworks, DeepInfra) que já hospeda o K3.
Use K3: volume alto, orçamento apertado, contexto gigante, quer rodar self-hosted, tarefa de raciocínio/códigoUse Claude (Fable/Opus): quando você precisa do topo absoluto de qualidade e o custo não é o gargalo — o Fable 5 ainda lidera o índice
Não é "trocar tudo". É ter a opção 70% mais barata pra 80% das tarefas.
| Quero… | Faça |
|---|---|
| Testar de graça | kimi.com, modo thinking on |
| Colocar num produto | API OpenAI-compatible, model=kimi-k3 |
| Codar | Cline/Aider apontando pra Moonshot |
| Rodar local | pesos no Hugging Face + vLLM |
Qualquer dúvida, me chama na DM. 🚀
— @99hud