Realizzazione — Sviluppo di IA agentica

Agenti che svolgono lavoro reale, entro limiti che fissate voi.

Un agente in grado di leggere, decidere e agire è utile solo se potete dire che cosa gli è consentito fare, dimostrare che cosa ha fatto e fermarlo all'istante. Onega progetta, sviluppa e valuta agenti di IA e flussi di lavoro in più fasi che operano nei vostri sistemi, con ogni chiamata agli strumenti verificata dalla policy, le azioni con conseguenze approvate da una persona e un registro di vostra proprietà.

01 — Che cosa realizziamo

Da un singolo compito a un flusso di lavoro governato.

Agenti per singoli compiti

Agenti dedicati a un unico scopo che smistano, estraggono, cercano, redigono bozze o riconciliano, e consegnano a una persona un risultato già preparato.

Flussi di lavoro in più fasi

Agenti che pianificano attraverso più strumenti e sistemi, con punti di controllo tra le fasi e un percorso di ritorno definito quando una fase non riesce.

Agenti di conoscenza

Risposte fondate sui vostri documenti e record, ciascuna con le proprie fonti, e un semplice «non trovato» quando le fonti non dicono nulla.

Integrazione di strumenti e sistemi

Connettori verso i vostri sistemi ERP, CRM, di service desk, documentali e di posta, tramite le loro API o il Model Context Protocol. Le credenziali non vengono mai fornite a un modello.

Banchi di prova per la valutazione

Set di test tratti dai vostri casi, valutati prima del rilascio e a ogni modifica, così che un nuovo modello o prompt debba prima dare prova di sé.

Gestione operativa

Monitoraggio, budget di costo, controlli della deriva e runbook per gli incidenti, per gli agenti in uso quotidiano.

02 — Autonomia

Un'autonomia che si regola per gradi, non con un interruttore.

Ogni classe di azioni ha un proprio livello. In un progetto pilota gli agenti partono da L0, e nulla sale di livello senza evidenze sui vostri casi e la vostra approvazione. La violazione di un guardrail è progettata per abbassare automaticamente il livello.

LivelloChe cosa fa l'agenteChe cosa richiediamo prima
L0 · OsservazioneFunziona in modalità shadow; nessuno agisce in base ai suoi risultatiUna baseline e un set di valutazione
L1 · SuggerimentoPropone; una persona conferma o correggeEvidenze e fonti per ogni proposta
L2 · Un clicPrepara un insieme di azioni; una persona lo esegueAzioni tipizzate e convalida deterministica
L3 · Automatico con revisioneEsegue un'azione qualificata; le persone vengono avvisate e possono annullarlaUna finestra di annullamento e un monitoraggio continuo
L4 · AutonomoEsegue senza supervisione una classe di azioni ristretta e collaudataAudit a campione, un budget di errore e declassamento automatico

03 — Controlli

Governato a ogni chiamata.

Quando gli agenti passano attraverso OneVeer, questi controlli si trovano nel percorso della richiesta. Se gestite già un gateway di IA, sviluppiamo in base ai suoi controlli e documentiamo eventuali lacune.

  • Un unico gateway governato per ogni chiamata ai modelli e agli strumenti, così che policy, oscuramento e budget si applichino a ogni agente.
  • Un arresto di emergenza firmato, circoscritto a un agente, a un modello o a tutto, applicato prima che qualsiasi modello venga raggiunto.
  • Approvazioni monouso da parte di una persona per le chiamate agli strumenti con conseguenze.
  • Credenziali custodite in un vault; i modelli vedono i risultati, mai le chiavi.
  • Modelli di guardia su input, contesto recuperato e output.
  • Un registro di ogni passaggio (input, fonti, chiamate agli strumenti, approvazioni ed esiti) conservato nel vostro ambiente.

04 — Come si svolge uno sviluppo

Due settimane per definire il perimetro, da sei a otto per dimostrare.

  1. 01

    Discovery Sprint · 2 settimane

    Il compito, gli strumenti, i dati, i rischi, il livello di autonomia da cui partire e i criteri di accettazione sui vostri casi.

  2. 02

    Sviluppo · 3–5 settimane

    Agente, connettori e set di valutazione realizzati nel vostro ambiente e testati su un campione di controllo (holdout).

  3. 03

    Esercizio supervisionato · 2–3 settimane

    Lavoro reale a L0 o L1, ogni proposta rivista, impegno ed errori misurati rispetto alla baseline.

  4. 04

    Consegna

    Runbook, configurazione, risultati delle valutazioni, limiti noti e una decisione: estendere, salire di livello o fermarsi.

05 — Domande frequenti

Le domande che ci pongono architetti e CISO.

Quali framework per agenti utilizzate?

Il più semplice che soddisfa il requisito, spesso semplice codice attorno alla chiamata di strumenti (tool calling) del modello. Se i vostri team si sono standardizzati su un framework o sul Model Context Protocol, sviluppiamo in conformità. La governance risiede nel gateway, non nel framework, quindi la scelta resta reversibile.

Gli agenti possono funzionare su modelli locali?

Sì. OneVeer supporta la chiamata di strumenti (tool calling) sia sui modelli locali sia tramite provider cloud, e un alias pubblicato può spostare un agente dagli uni agli altri senza modificare l'agente.

Che cosa impedisce che un agente venga manipolato da ciò che legge?

Tutto ciò che un agente legge è trattato come non attendibile. Gli strumenti sono inseriti in un'allow-list per ciascun agente, le credenziali non raggiungono mai il modello, modelli di guardia ispezionano gli input e il contesto recuperato, e le azioni con conseguenze richiedono l'approvazione di una persona. Il rilevamento è fallibile, quindi la progettazione presuppone che alcuni attacchi andranno a segno e limita ciò che potrebbero fare.

Chi risponde di ciò che fa un agente?

La vostra organizzazione: per questo ogni agente ha un responsabile nominativo, una versione, un registro delle valutazioni e limiti operativi concordati prima del go-live, e per questo il suo registro resta a voi.