Let's Dine - Recommandation de restaurants par géolocalisation
Sotis AI
Description
Le calcul est le même des deux côtés, une distance de Haversine entre l'utilisateur et chaque établissement. Ce qui change, c'est le volume : Pandas suffit et reste plus rapide sur quelques milliers de lignes, Spark ne devient rentable qu'au-delà, une fois le coût de distribution amorti. Écrire les deux versions donne la mesure de ce seuil au lieu de le supposer, sur une question qui se pose dans presque tout projet de données.
Outils & Technologies
Streamlit
BigQuery
Spark
Docker
Google Firebase
Google Analytics
AWS S3
GitHub
Python
Approche & Méthodes
Formule de Haversine pour le calcul de distance. Benchmark Pandas vs PySpark sur grands volumes.
Statut
Open source