GBR: EARS-0002 Padronização OpenAI, Streaming OTP e Poda de Contexto (`gbr_llm`) | Wiki
Documentação de engenharia e especificações técnicas da Gleam-BR.
GBR: EARS-0002 Padronização OpenAI, Streaming OTP e Poda de Contexto (gbr_llm)
*Requisitos Ubíquos (Ubiquitous Requirements)*
- *UBQ-LLM-01:* O Ator de Sessão LLM *deve* realizar todas as mutações no histórico de conversa (anexar mensagens) estritamente em memória, enviando o payload serializado apenas no instante da chamada HTTP.
*Requisitos Orientados a Eventos (Event-Driven Requirements)*
-
*EVD-LLM-01:* Quando a biblioteca
gunreceber um evento do tipochunkvia HTTP, o Ator de Sessão *deve* fazer o parse da linha SSE (data: {...}) e encaminhar o diferencial de texto para o PID do Ator consumidor original. -
*EVD-LLM-02:* Quando um chunk contiver a flag de finalização (
[DONE]oufinish_reason), o Ator de Sessão *deve* compilar a resposta completa, anexá-la ao seu histórico interno e emitir o eventoStreamFinishedao consumidor.
*Requisitos de Comportamento Indesejado (Unwanted Behavior Requirements)*
-
*UNW-LLM-01:* Se a API de terceiros retornar um código de erro de limitação de taxa (
429 Too Many Requests), o Ator *não deve* propagar a falha imediatamente, mas *deve* aplicar retentativa com Exponential Backoff até um limite máximo configurável.