Gleam.br Wiki

GBR: EARS-0002 Padronização OpenAI, Streaming OTP e Poda de Contexto (`gbr_llm`) | Wiki

Documentação de engenharia e especificações técnicas da Gleam-BR.

GBR: EARS-0002 Padronização OpenAI, Streaming OTP e Poda de Contexto (gbr_llm)

*Requisitos Ubíquos (Ubiquitous Requirements)*

  • *UBQ-LLM-01:* O Ator de Sessão LLM *deve* realizar todas as mutações no histórico de conversa (anexar mensagens) estritamente em memória, enviando o payload serializado apenas no instante da chamada HTTP.

*Requisitos Orientados a Eventos (Event-Driven Requirements)*

  • *EVD-LLM-01:* Quando a biblioteca gun receber um evento do tipo chunk via HTTP, o Ator de Sessão *deve* fazer o parse da linha SSE (data: {...}) e encaminhar o diferencial de texto para o PID do Ator consumidor original.
  • *EVD-LLM-02:* Quando um chunk contiver a flag de finalização ([DONE] ou finish_reason), o Ator de Sessão *deve* compilar a resposta completa, anexá-la ao seu histórico interno e emitir o evento StreamFinished ao consumidor.

*Requisitos de Comportamento Indesejado (Unwanted Behavior Requirements)*

  • *UNW-LLM-01:* Se a API de terceiros retornar um código de erro de limitação de taxa (429 Too Many Requests), o Ator *não deve* propagar a falha imediatamente, mas *deve* aplicar retentativa com Exponential Backoff até um limite máximo configurável.