¿Cuáles son los principios de la ciencia de los datos?
A medida que nuestra organización de Data Products creció en 2019, sentimos que habíamos alcanzado una masa crítica para definir mejor quién queríamos ser y cómo queríamos trabajar en 2020 y más allá. Con el tiempo, nuestros estándares y profesionalismo habían crecido y se hizo importante alinearse como un equipo, compuesto por científicos de datos e ingenieros de backend que están trabajando en diferentes equipos de las misiones . Nos inspiraron conceptos populares como el definición de impresionante acuñado por Spotify y nuestro propio principios de ingeniería .
Llevamos a la organización Data Products a París en agosto de 2019 para iniciar este esfuerzo colaborativo y, juntos, creamos estos directores.
Actualmente tenemos 15 principios de ciencia de datos categorizados en seis grupos:
Estrategia
Flujo de trabajo
Modelo
Pruebas de calidad y monitoreo
Ingeniería
Participación de las partes interesadas
Planeamos actualizarlos regularmente.
GetYourGuide principios de ciencia de datos
1. Estrategia
Los estrategia componente está directamente inspirado en lo que pensamos que impulsa Impacto de las empresas . Debido a que los productos de datos de construcción por lo general significa una inversión seria, queremos trabajar en la problemas correctos , los que impulsan el impacto empresarial y aportan valor a nuestros clientes.
Valor del cliente y del negocio sobre soluciones de lujo
Construimos nuestra estrategia y priorizamos nuestro trabajo desde el punto de vista del cliente y del negocio primero. No buscamos problemas para aplicar técnicas. Al priorizar, tenemos en cuenta el costo total, incluido el costo de oportunidad.
La exploración es uno de nuestros objetivos
Exploramos proactivamente nuevas ideas y desarrollamos pruebas de conceptos. Aunque el éxito nunca es seguro, siempre nos aseguramos de extraer enseñanzas de nuestros fracasos.
2. Flujo de trabajo
Ahora que tenemos problemas impactantes y relevantes en los que trabajar, la siguiente pregunta es: ¿Cómo trabajamos e iteramos ¿En ellos? En otras palabras, ¿cuál es nuestro flujo de trabajo? Nuestra estrella del norte es entregar valor lo más rápido posible y utilizar datos y análisis para definir los próximos pasos.
Manejamos activamente las incógnitas en nuestra planificación
Cada etapa del proyecto, incluidas las fases de investigación, está en un calendario y se caracteriza por su entregable. Dibujar una línea roja recta desde el principio hasta el final del proyecto nos ayuda a explorar tempranamente las numerosas incógnitas de un proyecto de ciencia de datos.
El análisis de datos informa dinámicamente nuestros planes de proyecto
Reiteramos continuamente nuestros planes de proyectos basados en información basada en datos que hemos obtenido principalmente de etapas anteriores del proyecto. Añadimos conscientemente las etapas del proyecto para recopilar más información sobre estos datos.
3. Modelo
El núcleo de nuestro trabajo es, y será siempre, el modelo. Un modelo debería, por supuesto, funcionar como se esperaba, pero hay más. Similar a la diferencia entre código y Código limpio , a gran modelo debe ser extensible, robusto y, si es posible, explicable.
Valoramos las pequeñas iteraciones en modelos existentes
Nos basamos en lo que ya está allí. Si tenemos que empezar desde cero, tratamos de establecer una línea de base lo más rápido posible.
Valoramos la explicabilidad sobre la precisión pura
Nuestro objetivo es construir algoritmos comprensibles y explicables. Construimos proactivamente procesos y herramientas para conectarnos con expertos en dominios y partes interesadas de modo que podamos identificar comportamientos extraños, alentar la retroalimentación y recopilar ideas.
El rendimiento está probado en línea
En última instancia, el valor del modelo se define como impacto en el mundo real y no sólo por evaluación offline. Definimos métricas de éxito claras y medibles y sólo lo llamamos éxito cuando se mide en línea.
4. Calidad, pruebas y seguimiento
Como organización madura, nos preocupamos por mantenimiento y garantía de calidad . Similar a la Si lo construyes, lo ejecutas. principal en ingeniería, somos nosotros los que mantenemos y operamos nuestros modelos. Por lo tanto, queremos hacernos un favor haciéndolos robustos y automatizando tanto como sea posible.
Seguimos principios de código limpio
Mantenemos al día los actuales principios de código limpio y los seguimos en consecuencia. Esto garantiza legibilidad, reutilizabilidad y flexibilidad en nuestra base de código, lo que facilita la prueba, depuración y entrega a otros miembros del equipo.
Prueba de conceptos (POC) son temporales
Al probar una nueva idea, está bien hacerlo lo más rápido posible. Después de la prueba, esto debe ser sacado de la producción o construido como un producto de calidad de producción.
Construimos procesos de despliegue sólidos y resistentes
Nuestros procesos de despliegue deben diseñarse para permitir una iteración rápida, minimizando al mismo tiempo el riesgo. Siempre que sea posible, debemos construir Gasoductos CI/CD y tener pruebas automatizadas para detectar problemas antes de que ocurran.
5. Ingeniería
La artesanía de Data Products se casa con la ciencia de los datos con software e ingeniería de datos . Pero, ¿qué aspectos de la ingeniería son importantes para los científicos de datos? Como pasamos mucho de nuestro tiempo de desarrollo con herramientas como Chispa y Flujo de aire , nos centramos principalmente en las mejores prácticas de construcción escalable tuberías de datos .
Nos integramos en el ecosistema de ingeniería y aprovechamos el código abierto
Construimos sobre nuestra pila de ingeniería común siempre que sea posible y usamos las mismas herramientas que los ingenieros. Cuando sea posible, aprovechamos los servicios cloud/api y preferimos fuertemente las bibliotecas de código abierto. Nos alineamos estrechamente con nuestros equipos de infraestructura/devops para evitar silos y sorpresas.
Los flujos de trabajo de datos son eficientes y eficaces en función de los costos
Diseñamos flujos de trabajo de datos con una perspectiva de ingeniería para aprovechar la paralelización de tareas y herramientas de big data. Nuestras soluciones están construidas para ser sostenibles y rentables.
Nos tomamos en serio la reproducibilidad y la modularidad
Los flujos de trabajo de datos y modelos son reproducibles, versionados y modulares, por lo que se facilita la depuración. Aprovechamos las configuraciones y las herramientas de orquestación para limitar el número de parámetros e intervenciones manuales. Siempre que sea posible, hacemos que los datos/puntuaciones que calculamos estén disponibles para que otras personas y equipos apalanquen y contribuyan.
6. Participación de las partes interesadas
Debido a que la ciencia de datos, y aún más, los productos de datos, son nuevos para muchas personas, no esperamos que nuestros socios de productos, ingeniería y negocios tengan un modelo mental de lo que hace una gran organización de productos de datos. Es por eso que queremos adoptar un enfoque muy proactivo para comprometernos con ellos. También dependemos de ellos para los datos – piensa jerarquía de las necesidades – así que una asociación es la clave para el éxito.
Promovemos la mentalidad de Data Product
Buscamos proactivamente oportunidades e impulsamos las ideas. Vemos a través de nuestras necesidades de las partes interesadas y proponemos soluciones creativas a los problemas empresariales que tienen. Explicación y promoción nuestra La forma de abordar los problemas forma parte de nuestras tareas fundamentales.
Nos integramos profundamente con las partes interesadas en los datos
Nuestros algoritmos utilizan datos recopilados por otros equipos. Nos asociamos con nuestros interesados para aprender qué datos recopilan y qué significan, para educarlos para lo que necesitamos sus datos, para marcar si falta información o es incorrecta, y para encontrar maneras de evitar problemas de datos de manera eficiente.
¿Interesado en poner en práctica estos principios? Echa un vistazo a la posiciones abiertas y unirse a nuestra organización de productos de datos.
Artículos Relacionados:
- ¿Cuáles son los principios básicos de la ciencia de los datos?
- ¿Cuáles son los fundamentos de la ciencia de los datos?
- ¿Qué es la ciencia de los datos en los principios de la ciencia de los datos?
- ¿Cuáles son los fundamentos y componentes de la ciencia de los datos?
- ¿Quién inventó el análisis de datos?