Como funciona
Três passos. Você pergunta, o Iryx decide e diz o quanto tem certeza, e você escolhe quando o sistema pode agir sozinho.
-
[ 01 · você envia ]
O contexto e as perguntas.
O contexto é a situação: uma mensagem, um registro, um JSON. Junto vão as perguntas, cada uma com as opções possíveis. São três tipos: escolher uma opção, sim ou não, um nível numa escala.
> contexto
Comprei um tênis na loja de vocês semana passada e veio no número errado. [...] Consigo trocar até sexta?
> perguntas
assunto?escolher uma: troca ou devolução · entrega atrasada · pagamento · cancelamento · dúvida sobre produto
precisa de resposta hoje?sim ou não
tom do cliente?escala: calmo · preocupado · irritado · furioso
-
[ 02 · o iryx decide ]
Uma resposta por pergunta.
Para cada pergunta, o Iryx devolve a opção escolhida, a confiança (de 0 a 1) e o espectro: a chance de cada opção, não só da escolhida.
< decisões
assuntotroca ou devolução · 0,93
resposta hojesim · 0,71
tompreocupado · 0,95
-
[ 03 · você define o limite ]
Acima do limite, age. Abaixo, uma pessoa confere.
Você escolhe a confiança mínima para o sistema agir sozinho. O que ficar abaixo vai para uma pessoa. A faixa (alta, média, baixa) é o corte que a Iryx recomenda.
limite do exemplo: 0,80
troca ou devolução · 0,93age sozinho
preocupado · 0,95age sozinho
resposta hoje: sim · 0,71pessoa confere
Exemplo: a troca de tênis do Teste agora, um teste real de 24.09.2026, com uma mensagem inventada. Os três tipos de pergunta e os valores são os daquele teste. O limite de 0,80 é só um exemplo: quem define é você.
Glossário
- Decisão
- Cada pergunta respondida. É também a unidade de cobrança.
- Contexto
- A situação que você envia: uma mensagem, um registro, um JSON.
- Confiança
- Um número de 0 a 1 que diz o quanto o Iryx tem certeza da opção escolhida.
- Espectro
- A chance de cada opção possível, e não só da escolhida.
- Faixa
- Alta, média ou baixa: o corte de confiança que a Iryx recomenda. Na baixa, confira antes de agir.
- Resposta tipada
- A resposta vem sempre num formato fixo (uma das opções, sim ou não, um nível da escala), que o software usa direto, sem interpretar texto.
[ números · gabarito próprio ]
Números do Iryx 1.0
Quase o mesmo acerto dos maiores modelos, em uma fração do tempo por caso. Nas contas, acerta todas. Dez sistemas, as mesmas perguntas, o gabarito próprio da Iryx.
- Sistemas:
- 10
- Perguntas:
- até 425
- Gabarito:
- próprio
- Respostas:
- 21–22 e 30.09.2026
- Medido:
- 22–23 e 30.09.2026
Quase o mesmo acerto,
uma fração do tempo.
Na prova principal inteira, 82,2%, contra 84,9% a 88,4% dos modelos de uso geral. Por caso, ~90 ms; os modelos de uso geral, de 802 a 4.747 ms, medidos em lote: não é o tempo de um pedido. O Nimble 9B, aberto, de 568 a 1.790 ms numa placa de vídeo pequena, de casa. Os mesmos casos para todos, na mesma ordem em todos os gráficos.
Acerto no gabarito próprio da Iryx. * No tempo, entra o agente ou a linha de comando que chamou o modelo, em lotes: não é o tempo de um pedido.
~74 mspor pedido de ~3 decisões, na mediana, pela API, sem passar pela internet e com a conexão mantida aberta; com conexão nova a cada pedido, ~90 ms. Os outros foram chamados por outros caminhos: veja a tabela.
82,2%na prova principal inteira (225 perguntas: contas + texto). Os modelos de uso geral acertam de 84,9% a 88,4%; o Jev 1.13, 80,9%; o Nimble 9B, 71,6% (68,4% no q4).
970 de 976nas contas, em duas provas lacradas, onde a verdade é a conta. Nas 33 que os dez sistemas fizeram, o Iryx acertou todas; os outros nove, de 14 a 31.
CH 02 · 10 segundos no tempo mediano · 10 sistemasREC
SistemaTempo por caso · como foi chamado10 s ÷ tempo por caso
Como ler
Cada quadrado é um caso completo, com ~3 decisões, no tempo mediano de cada sistema. É uma ilustração do tempo por caso, não medida de vazão. Iryx: 200 pedidos, 23.09.2026. GPT-5.5, GPT-5.6 Luna e Nimble 9B: 30.09.2026. Os outros: 300 casos, 21.09.2026.
Iryx, Jev 1.13 e Nimble 9B
Por pedido, pela API, com conexão nova a cada pedido. O Jev passa pela internet, com TLS; o Iryx, não: a diferença entre os dois não é só do modelo. Com a conexão mantida aberta, o Iryx fica em ~74 ms. O Nimble 9B roda localmente, pelo Ollama, numa placa de vídeo pequena, de casa: não representa uma placa adequada.
* Em lote
Os seis modelos de uso geral foram chamados em lotes, por um agente ou pela linha de comando. O tempo é o do lote dividido pelos casos, com a partida do programa: não é o tempo de um pedido. No lote, os casos saem juntos, no fim.
Todos os números
Acerto dos dez sistemas no gabarito próprio da Iryx, em cada prova
| Sistema | Contas 33 | Principal | Cega 1 100 | Cega 2 100 |
Só texto 192 | Inteira 225 |
| Iryx 1.0 | 100% | 79,2% | 82,2% | 86% | 73% |
| Jev 1.13 | 57,6% | 84,9% | 80,9% | 87% | 92% |
| Nimble 9B | 42,4% | 76,6% | 71,6% | 86% | 88% |
| Nimble 9B q4 | 42,4% | 72,9% | 68,4% | 86% | 87% |
| Claude Opus 5 | 93,9% | 87,5% | 88,4% | 96% | 97% |
| Claude Fable 5.1 | 87,9% | 88,5% | 88,4% | 96% | 93% |
| GPT-6 Astra | 90,9% | 86,5% | 87,1% | 95% | 96% |
| GPT-5.6 Sol | 87,9% | 87,5% | 87,6% | 96% | 95% |
| GPT-5.6 Luna | 87,9% | 84,4% | 84,9% | 86% | 91% |
| GPT-5.5 | 84,8% | 87,0% | 86,7% | 92% | 93% |
Acerto no gabarito próprio da Iryx; o número sob cada prova é o de perguntas. A principal inteira soma as 33 contas às 192 de texto. Respostas de 21.09.2026 (contas, principal e cega 1) e de 22.09.2026 (cega 2), medidas em 22 e 23.09.2026; as do GPT-5.5, do GPT-5.6 Luna e dos dois Nimble 9B, e as do GPT-5.6 Sol na cega 2, respostas e medida em 30.09.2026.
Tempo por caso e como cada sistema foi chamado
| Sistema | Tempo por caso mediana | Casos | Como foi chamado |
| Iryx 1.0 | 90 ms | 200 | API, sem passar pela internet, um pedido por vez, conexão nova a cada pedido (com a conexão mantida aberta: 74 ms) |
| Jev 1.13 | 412 ms | 300 | API do fornecedor, pela internet, conexão nova a cada pedido |
| Nimble 9B | 1.790 ms | — | API local do Ollama (/v1/systemone), um pedido por vez, numa placa de vídeo pequena, de casa, em que o modelo não cabe inteiro (parte na memória do processador) |
| Nimble 9B q4 | 568 ms | — | igual, na versão comprimida (q4), que cabe inteira na mesma placa |
| Claude Opus 5 | 802 ms* | 300 em 6 lotes | agente, em lotes de 50; tempo do lote ÷ 50 |
| Claude Fable 5.1 | 1.515 ms* | 300 em 6 lotes | agente, em lotes de 50; tempo do lote ÷ 50 |
| GPT-6 Astra | 4.069 ms* | 300 em 30 lotes | linha de comando da OpenAI, em lotes de 10, raciocínio baixo; tempo do processo ÷ 10 |
| GPT-5.6 Sol | 4.747 ms* | 300 em 30 lotes | linha de comando da OpenAI, em lotes de 10, raciocínio baixo; tempo do processo ÷ 10 |
| GPT-5.6 Luna | 2.714 ms* | — | linha de comando (Codex), em lotes de 10; tempo do lote ÷ 10 |
| GPT-5.5 | 2.491 ms* | — | linha de comando (Codex), em lotes de 10; tempo do lote ÷ 10 |
Um caso é um pedido com ~3 decisões. Iryx medido em 23.09.2026; GPT-5.5, GPT-5.6 Luna e Nimble 9B, em 30.09.2026; os outros, em 21.09.2026. — = sem número. O Iryx e o Jev 1.13 foram medidos com conexão nova a cada pedido, mas o tempo do Jev inclui a ida e volta pela internet e o aperto de mão TLS, e o do Iryx não inclui: a diferença entre os dois não é só do modelo. Nos lotes, o tempo de cada lote dividido pelos casos dele vale para todos os casos do lote. * Inclui o agente ou o programa que chamou o modelo, e a partida dele: não é o tempo de um pedido. Os modelos de uso geral receberam o mesmo enunciado; outra configuração pode dar outro número. O Nimble 9B é um modelo aberto (Apache 2.0), com 9 bilhões de parâmetros; o q4 é a versão comprimida dele. O tempo dele foi medido numa placa de vídeo pequena, de casa, em que a versão inteira não cabe e parte fica na memória do processador: não representa o tempo numa placa adequada ao modelo. Claude é marca da Anthropic; GPT, da OpenAI. Os nomes só identificam o sistema medido. Nenhuma dessas empresas participou nem endossa esta comparação.
Leitura. Em texto não existe gabarito neutro: este é o da Iryx, e outro gabarito pode dar outra ordem. Nas contas, a verdade é a conta: o Iryx acertou as 33. Em texto, os modelos de uso geral ficam à frente em todas as provas, com um só empate (o GPT-5.6 Luna, na cega 1) e a maior distância na cega 2, com um tempo por caso muito maior, medido em lote e com a partida do programa: não é o tempo de um pedido. Com 100 perguntas, diferença de até ~7 pontos cabe na margem de erro; com 192 ou 225, até ~5; nas 33 contas, a margem é bem maior. Na cega 2, o Iryx fica atrás de todos: 73%, contra 87% a 97% dos outros nove. O Nimble 9B, aberto e bem menor, fica atrás do Iryx no texto da principal, empata na cega 1 e fica à frente na cega 2. Tudo em textos curtos em português; os outros sistemas podem ter mudado depois.
Iryx 1.0 ou modelo de uso geral?
[ iryx ]
Quando o Iryx serve melhor
- Alto volume: muitas decisões por dia, cobradas uma a uma.
- Tempo real: a resposta precisa sair em milissegundos.
- Respostas fechadas: escolher uma opção, sim ou não, um nível numa escala.
- Custo previsível: preço por decisão, e não por token.
- Saber quando conferir: a confiança diz quando uma pessoa deve olhar.
[ uso geral ]
Quando um modelo de uso geral serve melhor
- Texto livre: escrever, resumir, traduzir, explicar.
- Conversas e tarefas abertas, sem uma lista de opções.
- Acerto máximo em texto: quando ele importa mais que o tempo e o custo. Nas provas de texto desta página, eles acertam mais.