Data Science 2023

Let's Dine - Recommandation de restaurants par géolocalisation

Sotis AI

Let's Dine - Recommandation de restaurants par géolocalisation
Cliquer pour agrandir

Description

Le calcul est le même des deux côtés, une distance de Haversine entre l'utilisateur et chaque établissement. Ce qui change, c'est le volume : Pandas suffit et reste plus rapide sur quelques milliers de lignes, Spark ne devient rentable qu'au-delà, une fois le coût de distribution amorti. Écrire les deux versions donne la mesure de ce seuil au lieu de le supposer, sur une question qui se pose dans presque tout projet de données.

Outils & Technologies

Streamlit BigQuery Spark Docker Google Firebase Google Analytics AWS S3 GitHub Python

Approche & Méthodes

Formule de Haversine pour le calcul de distance. Benchmark Pandas vs PySpark sur grands volumes.

Statut

Open source

Est-ce que ça se transpose chez vous ?

La réponse tient à votre donnée plus qu'à ce projet, et un échantillon suffit le plus souvent à la donner.