---
title: "Modelos K2 Horizon chegam totalmente abertos com pesos código e dados de treinamento"
author: "Lígia Lemos Maia"
date: "2026-09-05 06:00:00-03"
category: "Inteligência Artificial & Dados"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/09/05/modelos-k2-horizon-chegam-totalmente-abertos-com-pesos-codigo-e-dados-de-treinamento/md"
---

## Resumo
- O IFM lançou seis modelos K2 Horizon em 3 de setembro de 2026, com tamanhos entre 0,9 bilhão e 375 bilhões de parâmetros.
- O projeto libera pesos, código de treinamento, metodologias e dados quando as licenças permitem.
- A licença Apache 2.0 vale para modelos e código, enquanto os conjuntos de dados seguem regras próprias.
- Os modelos de 3,7B e 7B tinham todos os ativos públicos em 4 de setembro; versões maiores ainda aguardavam parte dos artefatos.
- O treinamento usou aproximadamente 20 trilhões de tokens, incluindo cerca de 10 trilhões de tokens sintéticos.
- A infraestrutura xLLM, logs de treinamento, configurações e resultados de avaliação também fazem parte da proposta de transparência.
- Desenvolvedores devem conferir o modelo, os ativos disponíveis e a licença específica antes de reutilizar o material.

---

Em 3 de setembro de 2026, o **Institute of Foundation Models (IFM)**, sediado em Abu Dhabi e ligado à MBZUAI, lançou a família K2 Horizon com seis modelos de inteligência artificial que vão de **0,9 bilhão a 375 bilhões de parâmetros**. O anúncio chama atenção porque coloca sob exame público partes que normalmente permanecem escondidas atrás de uma interface: os pesos, o código de treinamento, as metodologias e, quando as licenças permitem, os dados usados na formação dos modelos. Para quem desenvolve ou pesquisa IA, a pergunta deixa de ser apenas qual modelo responde melhor e passa a incluir outra questão: o que existe por trás da resposta e quanto desse processo pode ser conferido?

## Uma abertura que vai além dos pesos

Essa pergunta explica por que o K2 Horizon foi apresentado como uma iniciativa de abertura ampla, e não apenas como mais uma coleção de modelos com pesos disponíveis para download. Pesos são os valores numéricos ajustados durante o treinamento, uma espécie de memória estatística que orienta como o sistema transforma uma entrada em uma resposta. O [comunicado do IFM](https://ifm.ai/k2/press-release/) informa que o lançamento inclui pesos, código de treinamento, metodologias e, conforme a disponibilidade de licenciamento, os dados de treinamento. Para um pesquisador, essa combinação permite observar diferentes camadas do processo; para um desenvolvedor, ajuda a distinguir uma ferramenta que pode ser adaptada de outra cujo funcionamento permanece parcialmente inacessível.

Essa extensão também aparece na ideia de **IA verificável** defendida pelo projeto, expressão usada para indicar que a comunidade precisa de mais do que arquivos finais prontos para uso. A página oficial do K2 Horizon afirma que a transparência granular deve incluir receitas de construção de dados ou os próprios dados de pré-treinamento, permitindo que a comunidade inspecione, reproduza, ajuste e estenda os modelos. A imagem lembra menos uma caixa-preta entregue ao público e mais um ateliê aberto, no qual ainda é possível examinar materiais, ferramentas e etapas do trabalho. A promessa, portanto, tem valor prático: ela desloca a discussão sobre abertura da aparência do produto para a rastreabilidade de sua construção.

## O que foi liberado e sob quais condições

Essa abertura, porém, precisa ser lida junto com as condições de cada ativo. Os pesos dos modelos e o código são distribuídos sob a licença **Apache 2.0**, enquanto os conjuntos de dados seguem suas próprias licenças. Na prática, isso significa que a autorização para usar ou modificar o código não resolve automaticamente as regras aplicáveis a todos os dados associados ao treinamento. O anúncio usa a expressão "totalmente aberto", mas os detalhes mostram uma abertura graduada, na qual o pesquisador precisa verificar qual componente está disponível, em que versão e sob qual regime jurídico antes de reutilizá-lo.

Essa distinção fica mais clara quando se observa o conteúdo liberado ao redor dos modelos. O lançamento cobre **arquivos de configuração, logs de treinamento e resultados de avaliação**, além das receitas de construção de dados em situações nas quais a redistribuição dos dados brutos encontra restrições legais de terceiros. Logs são registros das etapas e dos acontecimentos durante o treinamento; configurações descrevem como o processo foi organizado; resultados de avaliação ajudam a entender como o modelo foi medido. Reunidos, esses elementos oferecem uma narrativa técnica mais detalhada, embora não eliminem os limites impostos pelas licenças dos dados, e essa tensão é parte central da notícia.

## Uma frota com níveis diferentes de abertura

Essa diferença entre a promessa geral e a entrega específica aparece na própria composição da frota K2 Horizon. A linha começa com os modelos de **0,9B e 3,7B**, passa por uma versão de 7B e chega ao modelo de 32B. As duas maiores configurações são o 36B-A4B e o 375B-A23B, nomenclaturas que combinam o tamanho total anunciado com a arquitetura indicada pelo projeto. A variação permite que a comunidade compare modelos de escalas distintas, mas também impede que o leitor trate todos eles como se tivessem recebido exatamente o mesmo conjunto de arquivos no mesmo momento.

Essa ressalva é decisiva para quem pretende baixar ou estudar uma versão específica. Em 4 de setembro de 2026, os modelos de **3,7B e 7B** apresentavam todos os ativos públicos, incluindo dados, receita, código e checkpoints, que são pontos salvos do estado do modelo durante o treinamento. Já os modelos de 36B e 375B tinham os pesos finais disponíveis, com compromisso de liberação futura de checkpoints intermediários, dados e código. O modelo de 32B havia sido publicado como um checkpoint de estágio 1, enquanto a versão final estava prevista para um lançamento posterior. O tamanho do modelo, portanto, não informa sozinho o grau de abertura que o usuário encontrará.

## O que os dados de treinamento revelam

Essa arquitetura de versões se conecta ao modo como a família foi treinada. Os modelos foram pré-treinados em aproximadamente **20 trilhões de tokens**, unidades que podem corresponder a partes de palavras, palavras ou sinais processados pelo sistema, incluindo cerca de 10 trilhões de tokens sintéticos. Aproximadamente 17% do corpus, ou conjunto de dados usado no treinamento, consiste em trajetórias de raciocínio lógico. Esses números não funcionam como uma garantia automática de qualidade, mas ajudam a dimensionar a quantidade e o tipo de material que o IFM associa à formação dos modelos.

Além dos modelos em si, o IFM liberou a infraestrutura de treinamento chamada **xLLM**, incluindo o código usado no pós-treinamento agente. Pós-treinamento é a etapa realizada depois do treinamento inicial para ajustar o comportamento do sistema em tarefas ou formatos específicos. O relatório também informa que os modelos de 3,7B, 7B, 32B e 36B-A4B foram treinados sobre a mesma base de 22 trilhões de tokens, o que foi apresentado como uma forma de permitir comparações escaláveis. Para a pesquisa, a existência de uma base comum dá um ponto de referência; para a leitura crítica, também exige atenção às diferenças entre a descrição geral de aproximadamente 20 trilhões e a base indicada para esse grupo de modelos.

## Por que isso interessa a desenvolvedores e pesquisadores

Esse conjunto de materiais muda o tipo de trabalho que pode ser feito em torno da família K2 Horizon. Um pesquisador interessado em avaliar um modelo pode consultar os resultados publicados e relacioná-los às configurações e aos registros de treinamento, em vez de observar apenas a resposta final em uma interface. Um desenvolvedor pode escolher uma escala compatível com seu objetivo e verificar se precisa trabalhar com pesos finais, com um checkpoint intermediário ou com uma versão cuja liberação de dados ainda está prevista. Os modelos estão disponíveis via **Hugging Face**, o que aproxima os arquivos de uma plataforma já usada para distribuição e experimentação de modelos de IA.

O valor prático está justamente na possibilidade de separar três perguntas que costumam aparecer misturadas: o modelo pode ser executado, ele pode ser modificado e sua origem pode ser examinada? No K2 Horizon, a resposta depende da versão e do ativo consultado. Os modelos menores de 3,7B e 7B foram descritos com todos os componentes públicos em 4 de setembro, enquanto as versões maiores ainda dependiam de liberações futuras para completar o conjunto de artefatos. Essa gradação oferece mais informação ao usuário, mas também transfere para ele a responsabilidade de ler a licença, conferir a versão e não confundir pesos abertos com dados integralmente redistribuíveis.

## O próximo passo é acompanhar o que falta

Essa responsabilidade ficará ainda mais clara à medida que os compromissos anunciados forem cumpridos. Para os modelos de 36B e 375B, o IFM indicou a liberação futura de checkpoints intermediários, dados e código; para o modelo de 32B, a versão final também estava prevista para depois do checkpoint inicial. O próximo passo anunciado, portanto, não é apenas testar os pesos já publicados, mas acompanhar a chegada dos artefatos prometidos e verificar se eles completam a documentação necessária para reproduzir ou comparar o desenvolvimento. A data de 4 de setembro funciona como um retrato da situação naquele momento, não como uma descrição imutável de toda a frota.

Para quem deseja explorar o projeto, a caixa de ferramentas começa com uma regra simples: identificar o modelo, conferir quais ativos estão efetivamente públicos e ler a licença correspondente antes de reutilizar qualquer componente. A [página oficial do K2 Horizon](https://ifm.ai/k2/) apresenta a proposta de transparência e a escala da família, enquanto os registros e as receitas ajudam a transformar a promessa de abertura em material de análise. O significado mais duradouro do lançamento está nessa mudança de pergunta: em vez de aceitar a inteligência artificial como uma voz saída do escuro, pesquisadores e desenvolvedores podem exigir que ela venha acompanhada de pistas sobre sua origem, seus limites e as escolhas que a fizeram existir.