Budowanie — Tworzenie agentów AI

Agenci, którzy wykonują realną pracę w granicach, które Państwo wyznaczą.

Agent, który potrafi czytać, decydować i działać, jest użyteczny tylko wtedy, gdy mogą Państwo określić, co wolno mu robić, udowodnić, co zrobił, i natychmiast go zatrzymać. Onega projektuje, buduje i ocenia agentów AI oraz wieloetapowe przepływy pracy działające w Państwa systemach: każde wywołanie narzędzia jest sprawdzane przez politykę, działania o istotnych skutkach zatwierdza człowiek, a zapis należy do Państwa.

01 — Co budujemy

Od pojedynczego zadania do nadzorowanego przepływu pracy.

Agenci zadaniowi

Agenci jednozadaniowi, którzy klasyfikują zgłoszenia, wyodrębniają dane, wyszukują informacje, przygotowują wersje robocze lub uzgadniają dane i przekazują przygotowany wynik człowiekowi.

Wieloetapowe przepływy pracy

Agenci, którzy planują działania w wielu narzędziach i systemach, z punktami kontrolnymi między krokami i określoną drogą powrotu, gdy krok się nie powiedzie.

Agenci wiedzy

Odpowiedzi oparte na Państwa dokumentach i rekordach, każda ze źródłami, oraz jasne „nie znaleziono”, gdy źródła nie zawierają odpowiedzi.

Integracja z narzędziami i systemami

Konektory do Państwa systemów ERP, CRM, service desk, systemów dokumentów i poczty przez ich API lub Model Context Protocol. Poświadczenia nigdy nie są przekazywane modelowi.

Środowiska ewaluacyjne

Zestawy testowe oparte na Państwa własnych przypadkach, oceniane przed wydaniem i przy każdej zmianie, tak aby nowy model lub prompt musiał najpierw udowodnić swoją wartość.

Eksploatacja

Monitorowanie, budżety kosztów, kontrole dryfu i runbooki na wypadek incydentów dla agentów w codziennym użyciu.

02 — Autonomia

Autonomię się stopniuje, a nie włącza.

Każda klasa działań otrzymuje własny poziom. W pilotażu agenci zaczynają od L0, a nic nie przechodzi na wyższy poziom bez dowodów na Państwa własnych przypadkach i Państwa zatwierdzenia. Naruszenie zabezpieczenia zaprojektowano tak, by automatycznie obniżało poziom.

PoziomCo robi agentCzego wymagamy wcześniej
L0 · ObserwacjaDziała w trybie cienia; nikt nie działa na podstawie jego wynikówPunkt odniesienia i zbiór ewaluacyjny
L1 · SugestiaProponuje; człowiek potwierdza lub korygujeDowody i źródła przy każdej propozycji
L2 · Jedno kliknięciePrzygotowuje zestaw działań; człowiek go wykonujeTypowane działania i deterministyczna walidacja
L3 · Automatycznie z przeglądemWykonuje zakwalifikowane działanie; ludzie są powiadamiani i mogą je cofnąćOkno na cofnięcie i ciągłe monitorowanie
L4 · AutonomiaWykonuje bez nadzoru wąską, sprawdzoną klasę działańAudyt wyrywkowy, budżet błędów i automatyczne obniżenie poziomu

03 — Mechanizmy kontrolne

Nadzór przy każdym wywołaniu.

Gdy agenci działają przez OneVeer, te mechanizmy kontrolne znajdują się w ścieżce żądania. Jeśli już korzystają Państwo z bramy AI, budujemy w oparciu o jej mechanizmy kontrolne i dokumentujemy wszelkie luki.

  • Jedna nadzorowana brama dla każdego wywołania modelu i narzędzia, dzięki czemu polityka, redagowanie i budżety obowiązują każdego agenta.
  • Podpisany wyłącznik awaryjny obejmujący jednego agenta, jeden model lub wszystko, egzekwowany, zanim żądanie dotrze do jakiegokolwiek modelu.
  • Jednorazowe zatwierdzenia przez człowieka dla wywołań narzędzi o istotnych skutkach.
  • Poświadczenia przechowywane w sejfie; modele widzą wyniki, nigdy klucze.
  • Modele ochronne dla danych wejściowych, pobranego kontekstu i danych wyjściowych.
  • Zapis każdego kroku (dane wejściowe, źródła, wywołania narzędzi, zatwierdzenia i wyniki) przechowywany w Państwa środowisku.

04 — Przebieg budowy

Dwa tygodnie na zakres, sześć do ośmiu na potwierdzenie.

  1. 01

    Discovery Sprint · 2 tygodnie

    Zadanie, narzędzia, dane, ryzyka, początkowy poziom autonomii i kryteria odbioru oparte na Państwa własnych przypadkach.

  2. 02

    Budowa · 3–5 tygodni

    Agent, konektory i zbiór ewaluacyjny zbudowane w Państwa środowisku i przetestowane na wydzielonej próbce testowej.

  3. 03

    Nadzorowana eksploatacja · 2–3 tygodnie

    Rzeczywista praca na poziomie L0 lub L1, przegląd każdej propozycji, nakład pracy i błędy mierzone względem punktu odniesienia.

  4. 04

    Przekazanie

    Runbook, konfiguracja, wyniki ewaluacji, znane ograniczenia i decyzja: rozszerzenie, podniesienie poziomu lub zatrzymanie.

05 — Pytania i odpowiedzi

Pytania, które zadają architekci i CISO.

Z jakich frameworków agentowych Państwo korzystają?

Z najprostszego, który spełnia wymagania; często jest to zwykły kod wokół mechanizmu wywoływania narzędzi przez model. Jeśli Państwa zespoły ustandaryzowały się na określonym frameworku lub na Model Context Protocol, budujemy zgodnie z nim. Nadzór znajduje się w bramie, a nie we frameworku, więc ten wybór pozostaje odwracalny.

Czy agenci mogą działać na modelach lokalnych?

Tak. OneVeer obsługuje wywoływanie narzędzi zarówno w modelach lokalnych, jak i przez dostawców chmurowych, a opublikowany alias pozwala przenieść agenta między nimi bez zmiany samego agenta.

Co chroni agenta przed manipulacją przez treści, które czyta?

Wszystko, co czyta agent, jest traktowane jako niezaufane. Narzędzia są dopuszczane osobno dla każdego agenta na podstawie listy dozwolonych, poświadczenia nigdy nie trafiają do modelu, modele ochronne sprawdzają dane wejściowe i pobrany kontekst, a działania o istotnych skutkach wymagają zatwierdzenia przez człowieka. Wykrywanie bywa zawodne, dlatego projekt zakłada, że niektóre ataki się przedostaną, i ogranicza to, co mogłyby wyrządzić.

Kto odpowiada za to, co robi agent?

Państwa organizacja. Dlatego każdy agent ma wyznaczonego właściciela, wersję, zapis ewaluacji i limity działania uzgodnione przed uruchomieniem produkcyjnym, a jego zapis pozostaje u Państwa.