Edge of Context

Tradução automática Este artigo foi traduzido automaticamente a partir da versão original em inglês.

Notas de campo práticas sobre as partes dos sistemas de AI que têm de sobreviver à produção: agentes, avaliação, segurança, memória, retrieval, engenharia de modelos e infraestrutura.

Escolha abaixo um percurso de acordo com o problema: sistemas de agentes, avaliação ou retrieval e linguagem. Para um guia de decisão mais curto, consulte Respostas rápidas.

Comece aqui

Três formas de entrar no trabalho

Sistemas de agentes

Engineering the Agentic Stack

Um percurso ligado por reasoning, memória, ferramentas, segurança, runtime e engenharia do harness.

Série principal

Em ordem. Comece pelo ciclo.

Deslize pelos seis artigos →

  1. 01 Loops de raciocínio de AI agents: ReAct, ReWOO e Plan-and-Execute 14 min
  2. 02 Arquitetura de memória para AI Agents: Checkpoints e Vector Stores 21 min
  3. 03 Uso de ferramentas por AI Agents: MCP, CLI, Skills e execução de código 24 min
  4. 04 Segurança de AI Agents: permissões, sandboxes e ameaças de MCP 39 min
  5. 05 Runtime de AI Agents de longa duração: sessões e checkpoints 43 min
  6. 06 Harness Engineering para AI Agents: conceber ciclos de controlo 27 min

Todos os artigos 33

  1. Engenharia de modelos · Infraestrutura de IA

    Guia de Serving do LoRAX: adaptadores LoRA em Kubernetes à escala

    Avalie e implemente o LoRAX para serving de adaptadores LoRA de cauda longa, com APIs atuais, endurecimento do chart de Kubernetes, segurança dos adaptadores, routing consciente da cache e compromissos face ao vLLM.

    · 12 min

  2. Engenharia de modelos · Ferramentas de desenvolvimento

    LLMs locais no macOS: Ollama, LM Studio, MLX, llama.cpp

    Compare ferramentas para LLMs locais no macOS por interface, formato do modelo, margem de memória, exposição de API e fluxo de desenvolvimento em Apple Silicon.

    · 7 min

  3. Engenharia de modelos · Infraestrutura de IA

    Escalar LLMs com paralelismo multi-GPU e multi-nó

    Como escalar grandes modelos de linguagem entre GPUs e nós com paralelismo de dados, totalmente sharded, tensor, pipeline, de contexto e de experts.

    · 11 min