Saltar al contenido

Recursos · Calidad de las respuestas

Búsqueda corporativa con resultado verificable en una evaluación pública.

Skyller obtuvo 71,93 puntos en EnterpriseRAG-Bench, una evaluación pública con más de 500 mil documentos y 500 preguntas. En el ranking consultado el 6 de septiembre de 2026, quedó en 4º lugar entre 22 sistemas, por delante de las configuraciones evaluadas de OpenAI File Search, Amazon Q, Azure AI Search, Vertex AI Search y NVIDIA AI Blueprints. Los resultados, el método y las respuestas están disponibles para consulta.

Ver cómo funciona
Skyller · Política de trabajo remoto
Skyller - Asistente IAPolítica de trabajo remoto

¿Cuántos días puedo trabajar desde casa por semana?

Skyller es una IA y puede cometer errores. Recuerda verificar.

Respondiendo

Demostración · datos ilustrativos

71,93 PUNTOS

nota general de la presentación de Skyller en EnterpriseRAG-Bench

+10,9 PUNTOS

diferencia frente a OpenAI File Search (61,03), en las configuraciones del ranking del 6 de septiembre de 2026

20 DE 20 CASOS

todos los casos sin respuesta en el acervo se identificaron correctamente; el resultado se limita a esos casos

4º DE 22

posición verificada en el ranking público el 6 de septiembre de 2026; Skyller entró en 2º el 12 de agosto

El ranking

Las configuraciones comparadas en la prueba.

El benchmark usa un acervo, 500 preguntas y un método de evaluación comunes. Cada fila representa la configuración presentada de ese sistema, con sus modelos y ajustes. Los resultados no evalúan todos los productos o versiones de cada proveedor.

Recorte del ranking público de EnterpriseRAG-Bench el 6 de septiembre de 2026, con la posición y la nota general de cada sistema.
metor.comPosición1Nota general80,34
Causal Dynamics LabPosición2Nota general78,95
TromlPosición3Nota general76,79
SkyllerPosición4Nota general71,93
OpenAI File SearchPosición8Nota general61,03
Amazon Q (Kendra)Posición10Nota general48,96
Azure AI SearchPosición11Nota general48,42
Vertex AI SearchPosición14Nota general41,87
NVIDIA AI BlueprintsPosición16Nota general37,73

Selección de las cuatro primeras posiciones y cinco sistemas de búsqueda corporativa. El ranking incluía 22 sistemas el 6 de septiembre de 2026. Nuevas presentaciones pueden cambiar posiciones y resultados; consulte la lista completa en el sitio de Onyx.

Cómo interpretar la posición

La posición compara las presentaciones publicadas en este benchmark, que reúne distintos tipos de sistemas. No clasifica todos los productos del mercado ni certifica condiciones comerciales. Skyller entró en 2º lugar el 12 de agosto de 2026 y aparecía en 4º, con los mismos 71,93 puntos, en la consulta del 6 de septiembre.

La evaluación

Un examen de ingreso para asistentes de empresa.

EnterpriseRAG-Bench lo mantiene Onyx, que vende un producto del mismo tipo y se excluye de su propio ranking para evitar conflicto de interés. El acervo, las preguntas, el corrector y el historial del ranking son públicos.

500 MIL

Una empresa entera, inventada

El acervo simula una empresa de tecnología que no existe: algo más de 500 mil documentos en nueve orígenes — mensajes internos, correos, tickets de proyecto, archivos compartidos, CRM, transcripciones de reuniones, código, soporte y wiki.

Es el volumen de una empresa real, no una muestra

A PROPÓSITO

Desordenado como la vida real

Después de generar los documentos, Onyx desordena el acervo: archivos mal guardados, casi duplicados en sistemas distintos, versiones desactualizadas y documentos que se contradicen abiertamente.

La prueba mide búsqueda en desorden, que es el caso de todos

500

Preguntas de gente real

Diez tipos, desde la simple con una sola fuente hasta la que exige juntar un proyecto entero, la que tiene información contradictoria y veinte cuya respuesta simplemente no está en el acervo.

Incluye la pregunta que tumba asistentes: la que no tiene respuesta

INDEPENDIENTE

Quien corrige no es Skyller

Cada respuesta se compara con la respuesta esperada y con la lista de hechos que debe contener. Los documentos se clasifican mediante tres evaluaciones independientes y decide la mayoría. El programa y las reglas son de Onyx.

Ningún paso de la corrección pasa por nosotros

Cómo sale la nota

Cuatro medidas, no una opinión.

Corrección · 77,0
El corrector lee la respuesta de Skyller y la respuesta esperada y juzga si dicen lo mismo. La diferencia de estilo no cuenta en contra; un número que no coincide, sí. Tres de cada cuatro respuestas fueron juzgadas correctas.
Completitud · 79,14
Cada pregunta trae una lista de hechos que la respuesta debe contener, revisados uno a uno. Cerca de cuatro de cada cinco hechos esperados aparecieron. La nota general de 71,93 combina esta medida con la corrección.
Documentos correctos · 81,6
De las fuentes que la evaluación considera necesarias para responder, cuatro de cada cinco fueron encontradas por la búsqueda. Es la medida que dice si el material correcto llegó a la respuesta.
Ruido · 8,86 por pregunta
Cuántos documentos irrelevantes trajo la búsqueda de más, en promedio. Aquí menos es mejor: cada archivo descartable es ruido que el modelo debe filtrar antes de responder.

El resultado

Tipo por tipo, sin recorte.

El promedio general esconde lo que más importa a una empresa: en qué tipo de pregunta la asistente es fuerte. La prueba separa las 500 preguntas en diez tipos, y la tabla de abajo es todo lo que Onyx publicó sobre Skyller.

Nota de Skyller en EnterpriseRAG-Bench por tipo de pregunta, con la cantidad de preguntas de cada tipo.
No está en el acervoPreguntas20Nota100,00Documentos correctos
Documentos informalesPreguntas20Nota85,00Documentos correctos100,0
Fragmentos distantes del mismo documentoPreguntas40Nota83,33Documentos correctos97,5
Pregunta directaPreguntas175Nota79,13Documentos correctos88,6
Información contradictoriaPreguntas20Nota74,57Documentos correctos92,5
Pregunta con salvedadPreguntas30Nota72,56Documentos correctos93,3
Pregunta de visión generalPreguntas10Nota68,00Documentos correctos
Pregunta indirectaPreguntas125Nota64,47Documentos correctos69,6
Documentos de un proyecto enteroPreguntas40Nota50,89Documentos correctos64,0
Traer todo lo que existePreguntas20Nota32,08Documentos correctos52,0

Fuente: archivo de resultados de Skyller publicado por Onyx en el repositorio del ranking. El guion aparece donde la evaluación no define documentos esperados. Las dos últimas filas son los frentes en los que el equipo trabaja para la próxima presentación.

Qué se probó

La presentación usó las rutas públicas del producto.

Las 500 respuestas se generaron por las rutas públicas de conversación de Skyller, en el entorno registrado para la presentación. Los modelos y ajustes usados forman parte de ese registro; los cambios posteriores del producto requieren una nueva evaluación.

  1. Punto de partida

    La pregunta literal de la evaluación, enviada en una conversación nueva, sin categoría, sin respuesta esperada, sin los documentos correctos y sin ningún contexto de pregunta anterior.

  2. Qué pasó en cada pregunta

    1. 01La pregunta entró por la misma ruta de conversación del producto, con el enrutamiento de modelo por defecto de la plataforma. El modelo que escribió la respuesta es de OpenAI — lo que la evaluación mide es el trabajo de Skyller alrededor de él.
    2. 02La búsqueda recorrió el acervo de 510.646 documentos y devolvió los fragmentos, por el mismo embudo que responde a una conversación de cliente. En una verificación de 100 preguntas, la ruta pública de búsqueda y el camino interno del asistente devolvieron la misma tasa de documentos correctos (83,72%) y el mismo documento arriba en el 93% de los casos.
    3. 03Onyx no se conformó con el archivo de respuestas: recibió acceso al producto en línea y mandó 80 preguntas que nunca habíamos visto, respondidas el mismo día por la misma ruta, dos días antes de publicar el resultado.
  3. Qué permite afirmar

    El archivo de respuestas que guardamos aquí tiene la misma huella (SHA-256 dfe926a3…) que el archivo que Onyx publicó en su repositorio. Nadie tiene que creer en nuestra palabra: las respuestas, el corrector y la cuenta están abiertos.

Skyller · Respuesta sin fuente publicada
Respuesta sin fuente publicada

¿Cuál es la nueva regla que todavía está en borrador?

Skyller es una IA y puede cometer errores. Recuerda verificar.

Respondiendo

Demostración · datos ilustrativos

Dónde se detiene la prueba

  • El acervo es en inglés y de una empresa ficticia. La prueba que vale para su empresa es la que se hace con sus documentos.
  • El entorno se ajustó para ese acervo. El resultado describe esa configuración; la calidad con otros documentos, idiomas y ajustes necesita medirse.

Qué significa

Por qué este número importa para su empresa.

Identificó los 20 casos sin respuesta
En las veinte preguntas cuya respuesta no existía en el acervo, Skyller indicó correctamente que no encontró. Ese resultado no garantiza ausencia de errores en otras preguntas. Las fuentes presentadas ayudan al equipo a verificar la respuesta antes de fundamentar una decisión.
Encuentra en medio del desorden
El acervo de la prueba fue desordenado a propósito, con archivos mal guardados, casi duplicados y documentos que se contradicen. Es el retrato de la carpeta compartida de cualquier empresa con algunos años de operación.
El método y las respuestas son públicos
Onyx mantiene el benchmark, publica el programa de evaluación y verificó la presentación con acceso a Skyller. Las respuestas y los resultados permiten examinar qué se midió y reproducir la evaluación.
Se puede verificar hoy
El ranking, el acervo, las preguntas, el corrector y nuestras 500 respuestas están publicados. Cualquier persona de su equipo puede abrirlos, comparar con otro proveedor y rehacer la cuenta.

A la hora de decidir

Cómo usar esto en su evaluación.

Si está comparando asistentes de IA para su empresa, tres cosas que este resultado vuelve fáciles de hacer.

  1. 01Quien va a usarlo

    Hágale la misma pregunta difícil a cada herramienta que esté probando

  2. 02Quien decide

    Pida la fecha y la fuente de cualquier número de calidad que reciba

  3. 03Quien cuida la TI

    Pregunte si la prueba presentada corrió en el producto en línea o en un entorno de demostración

Qué mostró la evaluación

  • Encontrar los documentos correctos en un acervo grande y desordenado
  • Responder con base en ellos, sin contradecir la fuente
  • Decir que no encontró cuando la información no existe

Qué solo muestra su propia prueba

  • Cómo se desempeña con los documentos y el vocabulario de su empresa
  • Quién puede ver cada documento y cada conexión
  • Las rutinas de su equipo corriendo de punta a punta

Preguntas

Lo que suelen preguntar.

Empezar

La prueba que decide es con sus documentos.

Un ranking público muestra que la búsqueda funciona en un acervo grande y desordenado, evaluada por quien no vende Skyller. Lo que no muestra es su empresa. Eso se descubre en una tarde, gratis.