Arquitetura de confiabilidade
Arquitetura de confiabilidade de IA da LMU AI: roteamento multi-origem, sondas de saúde e failover automático em três camadas; meta de disponibilidade de 99,5% nos planos Standard e Enterprise.
Tratamos a "estabilidade" como o recurso número um do produto. Esta página explica como conseguimos isso e o que acontece quando algo dá errado.
Por que a confiabilidade é tão difícil?
Desenvolvedores que se conectam diretamente à API oficial enfrentam coisas como:
- Limitação de taxa / indisponibilidade regional
- Um único canal de pagamento ou conta sendo banido
- Problemas de compatibilidade durante mudanças de versão de modelo
- Filas em horários de pico e picos de latência do primeiro token
Se um serviço de relay for apenas um proxy simples, esses problemas são repassados tal como estão aos usuários, ou até piorados. Nossa abordagem é projetar o sistema com base na premissa de que "os upstreams são instáveis", em vez de tratar isso como uma exceção.
Nossa arquitetura de roteamento multi-origem
Para cada chamada de API, a requisição é tratada seguindo o caminho abaixo:
Mecanismos centrais:
- Pool de múltiplos upstreams: vários canais independentes ficam atrás do mesmo modelo, evitando pontos únicos de falha
- Sondagem de saúde: monitoramos continuamente a taxa de sucesso, a latência do primeiro token e a taxa de limitação de cada upstream, e canais não saudáveis são automaticamente reduzidos de peso ou removidos
- Failover automático: quando o canal primário retorna 5xx / limitação de taxa / timeouts, a requisição muda para um canal de backup em milissegundos, geralmente sem impacto do seu lado
- Reconexão de interrupção de stream: quando uma resposta em streaming cai no meio, tentamos retomá-la em protocolos que oferecem suporte a isso
Nível de serviço (SLA)
Nossos compromissos externos são fundamentados no "que realmente podemos entregar" — não fazemos promessas vazias.
| Nível | Meta de disponibilidade | Relatório mensal | Contrato empresarial |
|---|---|---|---|
| Economy | Melhor esforço | — | Não aplicável |
| Standard | 99,5% | — | Não aplicável |
| Enterprise | 99,5% | Fornecido | SLA mais alto e termos de compensação disponíveis |
O nível Economy é para desenvolvedores individuais que querem o melhor custo-benefício e podem tolerar flutuações ocasionais; se o seu negócio tem requisitos rígidos de confiabilidade, escolha o nível Enterprise ou entre em contato com nossa equipe de vendas para um plano personalizado.
Como a disponibilidade é medida:
- Contamos apenas a taxa de sucesso das requisições "do lado da LMU AI", excluindo problemas de rede do lado do usuário, erros de parâmetros e recusas de conteúdo do próprio modelo upstream
- Uma falha isolada com duração < 60 segundos não é contabilizada
- O relatório mensal inclui taxas de sucesso e latência P95 detalhadas por modelo e por período de tempo
O que acontece durante um incidente
Oscilação breve (< 5 minutos)
- A camada de roteamento troca de upstreams automaticamente, sem anúncio
- A página de status registra o evento
Interrupção de um único upstream (< 1 hora)
- A camada de roteamento conclui a troca; se for visível para alguns usuários/modelos, publicamos na página de status
- Usuários Standard e Enterprise são notificados por e-mail
Impacto regional ou em múltiplos upstreams simultaneamente
- O evento é fixado na página de status com atualizações periódicas
- Usuários Enterprise recebem atualizações de progresso por e-mail em tempo real
- Um postmortem é publicado dentro de 48 horas após o término do evento
O que não fazemos
Para evitar enganar os usuários, atualmente não prometemos o seguinte:
- Troca contínua e com latência zero: o failover introduz latência extra de milissegundos a segundos, então nunca será completamente contínuo
- Compensação de compatibilidade entre modelos: se um modelo upstream em si for descontinuado (por exemplo, uma versão de modelo é encerrada pelo provedor), anunciamos isso em vez de trocar silenciosamente para um modelo diferente
- Novas tentativas ilimitadas: requisições que falham são repetidas um número limitado de vezes conforme a política, para que você não pague por chamadas repetidas inesperadas
FAQ
Por que ainda enfrento falhas ocasionalmente?
Nenhum sistema é 100% disponível. Nosso objetivo é manter a disponibilidade geral acima de 99,5% e recuperar rapidamente quando ocorrem falhas. Se você tiver falhas persistentes (por exemplo, o mesmo tipo de requisição falhando várias vezes em 5 minutos), entre em contato com o suporte com o seu request ID e priorizaremos a investigação.
Como faço para solicitar o nível Enterprise?
Consulte a página de Planos Enterprise ou entre em contato diretamente com vendas:
- E-mail: business@lmuai.com
- WeChat / telefone: 18599001010
Última atualização:
Obtenha uma chave de API da LMU AI e comece a usar Claude, Codex e muito mais
Cadastro gratuito e planos flexíveis. Uma única chave de API para Claude Code, Codex CLI, Cursor, extensão do VS Code, OpenCode, Cherry Studio e outras ferramentas de IA.
Cadastrar-seSegurança de chave
Guia de whitelist/blacklist de IP para chaves da API LMU AI: restrinja quais IPs podem chamar sua chave para impedir que uma chave vazada seja abusada; suporta IPs únicos e faixas CIDR.
Dados e privacidade
Tratamento de dados da LMU AI: o conteúdo de requisições e respostas nunca é persistido, os metadados de chamadas são mantidos por 90 dias e os dados de conta são armazenados apenas dentro da China.