Spørsmål
Ofte spurt om OneVeer.
Korte svar på spørsmålene evaluatorer stiller først. De samme svarene publiseres i sidens strukturerte data.
Hva er en LLM-gateway?
En LLM-gateway (også kalt en AI-gateway eller inferensgateway) er en server mellom applikasjoner og modeller. Applikasjoner kaller ett endepunkt; gatewayen autentiserer dem, velger modell eller leverandør, bruker policy og registrerer hva som skjedde. OneVeer er en LLM-gateway som også kjører modellene selv, på din egen maskinvare, i samme prosess.
Er OneVeer et alternativ til vLLM?
For en annen jobb. vLLM er et Python-serveringssystem bygget for datasentergjennomstrømning på GPU-klynger. OneVeer retter seg mot en enkelt node du kontrollerer: én innebygd server som kombinerer en llama.cpp inferensmotor (CPU, Vulkan, CUDA) med en gateway, en policymotor og leverandørruting. Velg vLLM for servering i klyngeskala; velg OneVeer når kravet er en styrt gateway som kjører der dataene dine bor.
Er OneVeer et alternativ til Ollama?
Ollama er en lokal modellløper rettet mot individuelle utviklere. OneVeer er bygget for å sette lokale modeller foran applikasjoner og team: applikasjonsnøkler med modellbevilgninger og grenser, en publisert modellkatalog, ruting til skyleverandører med fallback og budsjetter, beskytte modeller mot umiddelbar injeksjon, PII-redaksjon, en nødstopp, Prometheus-målinger og OpenTelemetry-eksport. Begge bruker llama.cpp/ggml-stabelen for lokal slutning.
Fungerer OneVeer med SDK-ene OpenAI og Anthropic?
Ja. OneVeer serverer OpenAI-kompatibel chat, fullføringer, innebygginger og modellerende endepunkter og Anthropic meldingsendepunkt. Pek SDK-ens basis-URL på OneVeer og behold klientkoden. Claude Code, Cursor, Codex CLI, LangChain, n8n, LibreChat og alle OpenAI-kompatible verktøy fungerer på samme måte.
Hvilken maskinvare kjører OneVeer på?
CPU, NVIDIA, AMD og Intel GPUer gjennom Vulkan (standardbygget), og NVIDIA GPUer gjennom CUDA. Windows 11 er den validerte plattformen; Linux- og macOS-bygg er ennå ikke sertifisert. OneVeer størrelser hver modell mot ledig minne og plasserer den på en GPU, på tvers av GPUer, som en MoE-hybrid med eksperter på RAM, eller på CPU.
Forlater data maskinen min?
Bare gjennom en leverandørrute du har konfigurert. Lokale modeller kjører i OneVeer-prosessen. En hovedbryter eller en topptekst per forespørsel fester forespørsler til lokale modeller. OpenTelemetry-eksport er av som standard og inkluderer aldri spørsmål, fullføringer, nyttelaster eller nøkler.
Hvordan håndterer OneVeer umiddelbar injeksjon og personopplysninger?
Guard-modeller (Prompt Guard 2, ProtectAI DeBERTa v3, Llama Guard 3 og Granite Guardian HAP) inspiserer input, hentet kontekst og utdata; en detektorfeil mislykkes lukket som standard. En lokal Rust-detektor finner e-postadresser, telefonnumre, betalingskort, IBAN-er, amerikanske SSN-er og IP-adresser og kan observere, erstatte, maskere, pseudonymisere eller avvise.
Hvilke modellformater støtter OneVeer?
GGUF filer for chattemodeller og BERT-familiekodere (innbygging, klassifisering, omrangering), pluss pakkede Whisper-, Piper- og Kokoro-modeller for tale. Modeller kan trekkes fra Hugging Face eller legges ned i modellmappen.
Er OneVeer åpen kildekode?
Nei. OneVeer er proprietær programvare fra Onega, tilgjengelig under en kommersiell lisens; lisenseieren er Onega. Den bygger på llama.cpp, som er MIT-lisensiert. Be om en gjennomgang for å evaluere den.