SushmithaS123/Project_for_tips
0
1import numpy as np2import streamlit as st3import pandas as pd4from sklearn.model_selection import train_test_split5from sklearn.preprocessing import OneHotEncoder, StandardScaler6from sklearn.tree import DecisionTreeRegressor7from sklearn.neighbors import KNeighborsRegressor8from sklearn.metrics import mean_squared_error9st.title(":red[Welcome to my ML Project]")10df = pd.read_csv("tips.csv")11 12y = df.pop("total_bill")13x = df14 15X_train, X_test, y_train, y_test = train_test_split(x,y, test_size=0.15, random_state=30)16 17numerical_data = X_train.select_dtypes("number")18cat_data = X_train.select_dtypes("object")19 20encoder = OneHotEncoder(sparse_output= False)21X_train_cat = pd.DataFrame(encoder.fit_transform(cat_data), columns=encoder.get_feature_names_out())22scaler = StandardScaler()23res = scaler.fit_transform(numerical_data)24X_train_num = pd.DataFrame(res, columns = numerical_data.columns)25Final_X_train_data = pd.concat([X_train_cat, X_train_num], axis=1)26 27 28 29X_test_num = X_test.select_dtypes("number")30X_test_cat = X_test.select_dtypes("object")31 32X_test_num_trans = scaler.transform(X_test_num)33res1 = pd.DataFrame(X_test_num_trans, columns = X_test_num.columns)34 35X_test_cat_trans = encoder.transform(X_test_cat)36res2 = pd.DataFrame(X_test_cat_trans, columns = encoder.get_feature_names_out())37 38Final_X_test = pd.concat([res2,res1], axis =1)39 40regression = KNeighborsRegressor()41regression.fit(Final_X_train_data, y_train)42y_pred = regression.predict(Final_X_test)43 44mean_squared_error(y_test, y_pred)45 46tip = st.number_input("Enter Customer Tip")47 48sex = ["Female", "Male"]49select_sex = st.selectbox("Select Customer Gender", sex)50 51smoker = ["No", "Yes"]52select_smoker = st.selectbox("Select Customer Smoker or not", smoker)53 54day = ["Sun", "Sat", "Fri", "Thur"]55select_day = st.selectbox("select day", day)56 57time = ["Dinner", "Lunch"]58select_time = st.selectbox("Select time", time)59 60size = st.number_input("Enter size")61 62if st.button("Predict Total Bill"):63 query_point = pd.DataFrame([64 {65 "tip" : tip,66 "sex" : select_sex,67 "smoker" : select_smoker,68 "day" : select_day,69 "time" : select_time, 70 "size" : size71 }]72 )73 74 cat_query_point = query_point.select_dtypes("object")75 76 num_query_point = query_point.select_dtypes("number")77 78 cat_query_point_trans = pd.DataFrame(encoder.transform(cat_query_point), columns= encoder.get_feature_names_out())79 num_query_point_trans = pd.DataFrame(scaler.transform(num_query_point), columns = X_test_num.columns)80 81 final_query_point = pd.concat([cat_query_point_trans, num_query_point_trans], axis = 1)82 83 def fun(query_point):84 res = regression.predict(query_point)[0]85 return res86 87 st.write(fun(final_query_point))