Geliştirme — Ajan tabanlı yapay zekâ geliştirme

Belirlediğiniz sınırlar içinde gerçek iş yapan ajanlar.

Okuyabilen, karar verebilen ve eyleme geçebilen bir ajan, ancak neler yapabileceğini söyleyebildiğiniz, ne yaptığını kanıtlayabildiğiniz ve onu anında durdurabildiğiniz sürece işe yarar. Onega, sistemlerinizde çalışan yapay zekâ ajanlarını ve çok adımlı iş akışlarını tasarlar, geliştirir ve değerlendirir: her araç çağrısı politikayla denetlenir, sonuç doğuran eylemler bir insan tarafından onaylanır ve kayıt size aittir.

01 — Ne geliştiriyoruz

Tek bir görevden yönetişim altındaki bir iş akışına.

Görev ajanları

Önceliklendiren, bilgi çıkaran, sorgulayan, taslak hazırlayan ya da mutabakat yapan ve hazırladığı sonucu bir insana teslim eden tek amaçlı ajanlar.

Çok adımlı iş akışları

Birden çok araç ve sistem genelinde plan yapan, adımlar arasında kontrol noktaları bulunan ve bir adım başarısız olduğunda tanımlı bir geri dönüş yolu olan ajanlar.

Bilgi ajanları

Belgelerinize ve kayıtlarınıza dayanan, her biri kaynaklarıyla birlikte sunulan yanıtlar; kaynaklarda yanıt yoksa açıkça “bulunamadı”.

Araç ve sistem entegrasyonu

ERP, CRM, servis masası, doküman ve posta sistemlerinize, bunların API'leri ya da Model Context Protocol üzerinden bağlayıcılar. Kimlik bilgileri asla bir modele verilmez.

Değerlendirme düzenekleri

Kendi vakalarınızdan derlenen, yayından önce ve her değişiklikte puanlanan test setleri; böylece yeni bir model ya da istem önce kendini kanıtlamak zorundadır.

İşletim

Günlük kullanımdaki ajanlar için izleme, maliyet bütçeleri, sapma kontrolleri ve olay müdahale kılavuzları (runbook).

02 — Otonomi

Açılıp kapanan değil, kademeli ayarlanan otonomi.

Her eylem sınıfı kendi düzeyini alır. Ajanlar pilotta L0 düzeyinde başlar; kendi vakalarınız üzerinde kanıt ve sizin onayınız olmadan hiçbir şey bir üst düzeye çıkmaz. Bir koruma sınırı ihlali, düzeyi otomatik olarak düşürecek şekilde tasarlandı.

DüzeyAjanın yaptığıÖnce şart koştuklarımız
L0 · GözlemGölge modda çalışır; sonuçlarına göre kimse işlem yapmazReferans ölçüm ve bir değerlendirme seti
L1 · ÖneriÖnerir; bir insan onaylar ya da düzeltirHer öneriyle birlikte kanıt ve kaynaklar
L2 · Tek tıkBir eylem seti hazırlar; bir insan bunu yürütürTipli eylemler ve deterministik doğrulama
L3 · İncelemeli otomatikKoşulları sağlayan bir eylemi yürütür; insanlar bilgilendirilir ve eylemi geri alabilirBir geri alma süresi ve sürekli izleme
L4 · OtonomDar kapsamlı, kanıtlanmış bir eylem sınıfını gözetimsiz yürütürÖrneklem denetimi, bir hata bütçesi ve otomatik düzey düşürme

03 — Kontroller

Her çağrıda yönetişim altında.

Ajanlar OneVeer üzerinden çalıştığında bu kontroller istek yolunda yer alır. Hâlihazırda bir YZ ağ geçidi işletiyorsanız, onun kontrollerine uygun geliştirir ve her türlü eksikliği belgeleriz.

  • Her model ve araç çağrısı için yönetişim altındaki tek bir ağ geçidi; böylece politika, karartma ve bütçeler her ajana uygulanır.
  • Kapsamı tek bir ajan, tek bir model ya da her şey olabilen, herhangi bir modele ulaşılmadan önce uygulanan imzalı bir acil durdurma anahtarı.
  • Sonuç doğuran araç çağrıları için bir insandan alınan tek kullanımlık onaylar.
  • Kimlik bilgileri bir kasada tutulur; modeller anahtarları asla görmez, yalnızca sonuçları görür.
  • Girdiler, erişilen bağlam ve çıktılar üzerinde koruma modelleri.
  • Her adımın (girdiler, kaynaklar, araç çağrıları, onaylar ve sonuçlar) ortamınızda tutulan bir kaydı.

04 — Geliştirme nasıl işler

Kapsamı belirlemek için iki hafta, kanıtlamak için altı ila sekiz hafta.

  1. 01

    Discovery Sprint · 2 hafta

    Görev, araçlar, veriler, riskler, başlangıç otonomi düzeyi ve kendi vakalarınız üzerinde tanımlanan kabul kriterleri.

  2. 02

    Geliştirme · 3–5 hafta

    Ortamınızda geliştirilen ve ayrılmış bir test örneklemi (holdout) üzerinde test edilen ajan, bağlayıcılar ve değerlendirme seti.

  3. 03

    Gözetim altında çalıştırma · 2–3 hafta

    L0 ya da L1 düzeyinde gerçek iş; her öneri incelenir, emek ve hatalar referans değerlere göre ölçülür.

  4. 04

    Devir teslim

    İşletim kılavuzu (runbook), yapılandırma, değerlendirme sonuçları, bilinen sınırlamalar ve bir karar: genişletmek, bir düzey yükseltmek ya da durdurmak.

05 — SSS

Mimarların ve CISO'ların sorduğu sorular.

Hangi ajan çerçevelerini kullanıyorsunuz?

Gereksinimi karşılayan en basit olanı; çoğu zaman bir modelin araç çağırma özelliği etrafında yazılmış sade kod. Ekipleriniz bir çerçeveyi ya da Model Context Protocol'ü standart olarak benimsediyse ona uygun geliştiririz. Yönetişim çerçevede değil ağ geçidinde yer aldığı için bu seçim geri alınabilir kalır.

Ajanlar yerel modellerle çalışabilir mi?

Evet. OneVeer, bulut sağlayıcılarının yanı sıra yerel modellerde de araç çağırmayı destekler; yayımlanmış bir takma ad, ajanı değiştirmeden onu bunlar arasında taşıyabilir.

Bir ajanın okuduğu içerik tarafından manipüle edilmesini ne engeller?

Bir ajanın okuduğu her şey güvenilmez kabul edilir. Araçlar her ajan için ayrı bir izin listesiyle sınırlanır, kimlik bilgileri asla modele ulaşmaz, koruma modelleri girdileri ve erişilen bağlamı inceler, sonuç doğuran eylemler ise bir insanın onayını gerektirir. Tespit yanılabilir; bu nedenle tasarım, bazı saldırıların geçebileceğini varsayar ve bunların yapabileceklerini sınırlar.

Bir ajanın yaptıklarından kim sorumludur?

Kuruluşunuz. Bu yüzden her ajanın adı belirlenmiş bir sahibi, bir sürümü, bir değerlendirme kaydı ve canlıya alınmadan önce üzerinde anlaşılan işletim sınırları vardır; kaydı da bu yüzden sizde kalır.