Projekty

Systemy, eksperymenty i dowody

Wybrane publiczne projekty z dostępnym kodem, wnioskami o określonym zakresie i jawnymi ograniczeniami. Każdy przykład pokazuje problem, granice systemu, mój wkład, sposób oceny i zakres dostępnych dowodów.

  • Engineering the Agentic Stack

    Problem: Niezawodność agentów często sprowadza się do wyboru modelu, choć błędy obejmują rozumowanie, pamięć, narzędzia, uprawnienia, środowisko wykonawcze i kontrolę wydań.

    Wkład: Opracowałem sześcioczęściową architekturę produkcyjną i implementację referencyjną Market Analyst Agent, która łączy te warstwy.

    Dowody: Przeczytaj serię · Sprawdź kod

    Decyzja: Traktuj warstwę sterującą i jej niezależne kontrole jako część produktu, a koszt każdego dodanego mechanizmu uzasadniaj przez ablację.

    Ograniczenie: To system referencyjny i metoda inżynierska, a nie opublikowany benchmark produkcyjny.

  • Od śladów wykonania do zestawów testów

    Problem: Ocena samej odpowiedzi pomija niewywołane narzędzia, niebezpieczne argumenty, pętle i przedwczesne deklaracje sukcesu.

    Wkład: Opisałem metodę przekształcania śladów działania agentów produkcyjnych w testy regresji. Zbudowałem też uruchamialne środowisko ewaluacji RAG obejmujące wyszukiwanie, filtry, reranking, generowanie, modele oceniające i opóźnienia.

    Dowody: Poznaj metodę ewaluacji agentów · Uruchom ewaluator RAG

    Decyzja: Wersjonuj ślady błędów jako przypadki testowe. Łącz deterministyczne kontrole przebiegu działania ze skalibrowanymi modelami oceniającymi tylko tam, gdzie potrzebna jest interpretacja.

    Ograniczenie: Publiczny ewaluator korzysta ze SciFact i przykładów o ograniczonym zakresie; wyników nie można automatycznie przenieść na inny korpus lub model.

  • TypeScript Agent Service

    Problem: Inżynierowie ML pracujący w Pythonie potrzebują tworzyć i przeglądać usługi agentowe w TypeScript o strukturze zbliżonej do produkcyjnej, bez uczenia się backendu od podstaw.

    Wkład: Zbudowałem monorepo pnpm ze strumieniowym API Hono, walidowaną pętlą narzędzi, warstwą danych Drizzle, workerem, serwerem MCP, obserwowalnością i 40 testami.

    Dowody: Przeczytaj przewodnik implementacyjny · Sprawdź kod

    Decyzja: Odwzoruj znane granice usług — Pydantic, FastAPI, kolejki i przechowywanie danych — na odpowiedniki w TypeScript, zachowując ścisłe schematy na każdej granicy narzędzia.

    Ograniczenie: To lokalna usługa referencyjna, a nie hostowany produkt ani opis konkretnego systemu pracodawcy.

  • Stos rankingu wyników wyszukiwania

    Problem: Stosy wyszukiwania ukrywają, który etap poprawia trafność, a który tylko zwiększa koszt.

    Wkład: Zbudowałem pięcioetapowe demo obejmujące BM25, wyszukiwanie wektorowe, reciprocal-rank fusion, reranking z cross-encoderem i ranking całej listy przez LLM na próbce danych Amazon ESCI.

    Dowody: Przeczytaj analizę etapów · Uruchom kod

    Decyzja: Mierz każdy etap oddzielnie i zachowuj go tylko wtedy, gdy poprawa trafności uzasadnia opóźnienie i koszt działania.

    Ograniczenie: Korpus jest próbką, a artykuł oznacza nieaktualny wiersz LLM jako materiał, który nie stanowi dowodu.

Sprawdź materiały bezpośrednio: uruchom eksperyment lub przeglądaj blog według tematów: systemy agentowe, wyszukiwanie i język albo inżynieria modeli.