Frågor
Vanliga frågor om OneVeer.
Korta svar på de frågor som utvärderarna ställer först. Samma svar publiceras i sidans strukturerade data.
Vad är en LLM-gateway?
En LLM-gateway (även kallad en AI-gateway eller inferens-gateway) är en server mellan applikationer och modeller. Applikationer kallar en slutpunkt; gatewayen autentiserar dem, väljer modell eller leverantör, tillämpar policy och registrerar vad som hände. OneVeer är en LLM-gateway som också kör själva modellerna, på din egen hårdvara, i samma process.
Är OneVeer ett alternativ till vLLM?
För ett annat jobb. vLLM är ett Python-serversystem byggt för datacentergenomströmning på GPU-kluster. OneVeer riktar sig mot en enda nod som du kontrollerar: en inbyggd server som kombinerar en llama.cpp inferensmotor (CPU, Vulkan, CUDA) med en gateway, en policymotor och leverantörsrouting. Välj vLLM för servering i klusterskala; välj OneVeer när kravet är en styrd gateway som körs där din data finns.
Är OneVeer ett alternativ till Ollama?
Ollama är en lokal modelllöpare riktad till enskilda utvecklare. OneVeer är byggd för att sätta lokala modeller framför applikationer och team: applikationsnycklar med modellbeviljande och gränser, en publicerad modellkatalog, routing till molnleverantörer med reserv och budgetar, skydda modeller mot omedelbar injektion, PII-redaktion, ett nödstopp, Prometheus-mått och OpenTelemetry-export. Båda använder llama.cpp/ggml-stacken för lokal slutledning.
Fungerar OneVeer med SDK:erna OpenAI och Anthropic?
Ja. OneVeer serverar OpenAI-kompatibla chatt-, kompletterings-, inbäddnings- och modellerslutpunkter och Anthropic meddelandeslutpunkten. Peka SDK:s bas-URL på OneVeer och behåll klientkoden. Claude Code, Cursor, Codex CLI, LangChain, n8n, LibreChat och alla OpenAI-kompatibla verktyg fungerar på samma sätt.
Vilken hårdvara körs OneVeer på?
CPU, NVIDIA, AMD och Intel GPU:er till Vulkan (standardbygget) och NVIDIA GPU:er till CUDA. Windows 11 är den validerade plattformen; Linux- och macOS-versioner är ännu inte certifierade. OneVeer storleksanpassar varje modell mot ledigt minne och placerar den på en GPU, över GPU:er, som en MoE-hybrid med experter på RAM, eller på processorn.
Lämnar data min maskin?
Endast via en leverantörsrutt som du har konfigurerat. Lokala modeller körs i OneVeer-processen. En huvudströmbrytare eller en header per begäran stiftar förfrågningar till lokala modeller. OpenTelemetry-export är avstängd som standard och inkluderar aldrig uppmaningar, slutföranden, verktygsnyttolaster eller nycklar.
Hur hanterar OneVeer omedelbar injektion och personuppgifter?
Guard-modeller (Prompt Guard 2, ProtectAI DeBERTa v3, Llama Guard 3 och Granite Guardian HAP) inspekterar input, hämtat sammanhang och utdata; ett detektorfel misslyckas stängt som standard. En lokal Rust-detektor hittar e-postadresser, telefonnummer, betalkort, IBAN, US SSN och IP-adresser och kan observera, ersätta, maskera, pseudonymisera eller förneka.
Vilka modellformat stöder OneVeer?
GGUF filer för chattmodeller och BERT-familjekodare (inbäddningar, klassificering, omrangering), plus paketerade Whisper-, Piper- och Kokoro-modeller för tal. Modeller kan dras från Hugging Face eller släppas i modellmappen.
Är OneVeer öppen källkod?
Nej. OneVeer är proprietär programvara från Onega, tillgänglig under en kommersiell licens; licensägaren är Onega. Den bygger på llama.cpp, som är MIT-licensierad. Begär en genomgång för att utvärdera den.