Spørgsmål
Ofte spurgt om OneVeer.
Korte svar på de spørgsmål, som evaluatorerne stiller først. De samme svar offentliggøres i sidens strukturerede data.
Hvad er en LLM-gateway?
En LLM-gateway (også kaldet en AI-gateway eller inferens-gateway) er en server mellem applikationer og modeller. Applikationer kalder ét slutpunkt; gatewayen autentificerer dem, vælger model eller udbyder, anvender politik og registrerer, hvad der skete. OneVeer er en LLM-gateway, der også kører selve modellerne, på din egen hardware, i samme proces.
Er OneVeer et alternativ til vLLM?
Til et andet job. vLLM er et Python-serveringssystem bygget til datacentergennemstrømning på GPU-klynger. OneVeer retter sig mod en enkelt node, du kontrollerer: én indbygget server, der kombinerer en llama.cpp inferensmotor (CPU, Vulkan, CUDA) med en gateway, en policy-motor og udbyderrouting. Vælg vLLM til servering i klyngeskala; vælg OneVeer, når kravet er en styret gateway, der kører, hvor dine data bor.
Er OneVeer et alternativ til Ollama?
Ollama er en lokal modelløber rettet mod individuelle udviklere. OneVeer er bygget til at sætte lokale modeller foran applikationer og teams: applikationsnøgler med modelbevillinger og begrænsninger, et offentliggjort modelkatalog, routing til cloud-udbydere med fallback og budgetter, beskytte modeller mod hurtig indsprøjtning, PII-redaktion, et nødstop, Prometheus-metrics og OpenTelemetry-eksport. Begge bruger llama.cpp/ggml-stakken til lokal inferens.
Fungerer OneVeer med SDK'erne OpenAI og Anthropic?
Ja. OneVeer serverer OpenAI-kompatible chat-, fuldførelser, indlejringer og modellerendepunkter og Anthropic-beskedslutpunktet. Peg SDK's basis-URL på OneVeer og behold klientkoden. Claude Code, Cursor, Codex CLI, LangChain, n8n, LibreChat og ethvert OpenAI-kompatibelt værktøj fungerer på samme måde.
Hvilken hardware kører OneVeer på?
CPU, NVIDIA, AMD og Intel GPU'er til Vulkan (standard build) og NVIDIA GPU'er til CUDA. Windows 11 er den validerede platform; Linux- og macOS-builds er endnu ikke certificeret. OneVeer størrelser hver model mod ledig hukommelse og placerer den på en GPU, på tværs af GPU'er, som en MoE-hybrid med eksperter i RAM eller på CPU'en.
Forlader data min maskine?
Kun gennem en udbyderrute, du har konfigureret. Lokale modeller kører inde i OneVeer-processen. En hovedafbryder eller en header pr. anmodning fastlægger anmodninger til lokale modeller. OpenTelemetry-eksport er slået fra som standard og inkluderer aldrig prompter, fuldførelser, værktøjsnyttelast eller nøgler.
Hvordan håndterer OneVeer hurtig indsprøjtning og personlige data?
Guard-modeller (Prompt Guard 2, ProtectAI DeBERTa v3, Llama Guard 3 og Granite Guardian HAP) inspicerer input, hentet kontekst og output; en detektorfejl lukkes som standard. En lokal Rust-detektor finder e-mailadresser, telefonnumre, betalingskort, IBAN'er, amerikanske SSN'er og IP-adresser og kan observere, erstatte, maskere, pseudonymisere eller afvise.
Hvilke modelformater understøtter OneVeer?
GGUF filer til chatmodeller og BERT-familiekodere (indlejringer, klassificering, omrangering), plus pakkede Whisper-, Piper- og Kokoro-modeller til tale. Modeller kan trækkes fra Hugging Face eller lægges ned i modelmappen.
Er OneVeer open source?
Nej. OneVeer er proprietær software fra Onega, tilgængelig under en kommerciel licens; licensejeren er Onega. Det bygger på llama.cpp, som er MIT-licenseret. Anmod om en gennemgang for at evaluere den.