Preguntas
Preguntas frecuentes sobre OneVeer.
Respuestas breves a las preguntas que hacen primero los evaluadores. Las mismas respuestas se publican en los datos estructurados de la página.
¿Qué es una puerta de enlace LLM?
Una puerta de enlace LLM (también llamada puerta de enlace AI o puerta de enlace de inferencia) es un servidor entre aplicaciones y modelos. Las aplicaciones llaman a un punto final; la puerta de enlace los autentica, elige el modelo o proveedor, aplica la política y registra lo sucedido. OneVeer es una puerta de enlace LLM que también ejecuta los modelos, en su propio hardware, en el mismo proceso.
¿Es OneVeer una alternativa a vLLM?
Para un trabajo diferente. vLLM es un sistema de servicio Python creado para el rendimiento del centro de datos en clústeres de GPU. OneVeer apunta a un único nodo que usted controla: un servidor nativo que combina un motor de inferencia llama.cpp (CPU, Vulkan, CUDA) con una puerta de enlace, un motor de políticas y enrutamiento de proveedor. Elija vLLM para la publicación a escala de clúster; elija OneVeer cuando el requisito sea una puerta de enlace gobernada que se ejecute donde residen sus datos.
¿Es OneVeer una alternativa a Ollama?
Ollama es un corredor de modelos local dirigido a desarrolladores individuales. OneVeer está diseñado para poner modelos locales frente a aplicaciones y equipos: claves de aplicación con concesiones y límites de modelos, un catálogo de modelos publicado, enrutamiento a proveedores de nube con respaldo y presupuestos, modelos de protección contra inyección rápida, redacción de PII, una parada de emergencia, métricas de Prometheus y exportación de OpenTelemetry. Ambos usan la pila llama.cpp/ggml para la inferencia local.
¿Funciona OneVeer con los SDK OpenAI y Anthropic?
Sí. OneVeer sirve chat, completaciones, incrustaciones y modelos de puntos finales compatibles con OpenAI y el punto final de mensajes Anthropic. Apunte la URL base del SDK a OneVeer y conserve el código del cliente. Claude Code, Cursor, Codex CLI, LangChain, n8n, LibreChat y cualquier herramienta compatible con OpenAI funcionan de la misma manera.
¿En qué hardware se ejecuta OneVeer?
CPU, GPU NVIDIA, AMD e Intel hasta Vulkan (la compilación predeterminada) y GPU NVIDIA hasta CUDA. Windows 11 es la plataforma validada; Las versiones de Linux y macOS aún no están certificadas. OneVeer dimensiona cada modelo con respecto a la memoria libre y lo coloca en una GPU, entre GPU, como un híbrido MoE con expertos en RAM o en la CPU.
¿Los datos salen de mi máquina?
Solo a través de una ruta de proveedor que hayas configurado. Los modelos locales se ejecutan dentro del proceso OneVeer. Un interruptor maestro o un encabezado por solicitud fija las solicitudes a los modelos locales. La exportación de OpenTelemetry está desactivada de forma predeterminada y nunca incluye mensajes, finalizaciones, cargas útiles de herramientas o claves.
¿Cómo maneja OneVeer la inyección rápida y los datos personales?
Los modelos Guard (Prompt Guard 2, ProtectAI DeBERTa v3, Llama Guard 3 y Granite Guardian HAP) inspeccionan la entrada, el contexto recuperado y la salida; un fallo del detector falla cerrado de forma predeterminada. Un detector Rust local encuentra direcciones de correo electrónico, números de teléfono, tarjetas de pago, IBAN, SSN de EE. UU. y direcciones IP y puede observar, reemplazar, enmascarar, seudonimizar o negar.
¿Qué formatos de modelo admite OneVeer?
GGUF archivos para modelos de chat y codificadores de la familia BERT (incrustaciones, clasificación, reclasificación), además de modelos empaquetados Whisper, Piper y Kokoro para voz. Los modelos pueden extraerse de Hugging Face o colocarse en la carpeta de modelos.
¿Es OneVeer de código abierto?
No. OneVeer es software propietario de Onega, disponible bajo una licencia comercial; el propietario de la licencia es Onega. Se basa en llama.cpp, que tiene licencia del MIT. Solicite un recorrido para evaluarlo.