- ▍ почему быть гиком и нёрдом стало модно?
- ▍ гики
- ▍ нёрд
- Не для новичков
- Теория vs. Практика Теория и Практика
- Живое общение
- Kaggle в действии
- Бесплатно
- Accuracy
- Accuracy, precision и recall
- Auc-roc и auc-pr
- Logistic loss
- Precision, recall и f-мера
- Благодарности
- Гбпоу рк романовский колледж индустрии гостеприимства (ркиг)
- Материалы курса
- Подробнее о новом запуске
- Полезные ссылки
▍ почему быть гиком и нёрдом стало модно?
Информационная революция в 90-е годы в США и в нулевые в остальном мире вывела «умников»-айтишников на первый план. Оказалось, что именно «очкарики», гики и нёрды, Биллы Гейтсы, Стивы Джобсы и Марки Цукерберги, создают глобальную компьютерную среду, в которую погружалась планета.
В айти-сферу хлынули колоссальные капиталы и инвестиции, зарплаты в этой сфере для опытных специалистов нередко опережали то, что мог заработать удачливый средней руки коммерсант. Совсем недавно кумирами миллионов и образцами для подражания были спортсмены, актёры и звёзды музыки.
Теперь же быть гиком и нёрдом от айти становилось всё более модно, популярно и выгодно. Именно тогда возникла полушутливая поговорка: «не травите в школе гиков и нёрдов, скорее всего, вам придётся работать на них в будущем». А в 2022 году британский культуролог Марк Рёдер попытался осмыслить происходящее в нашумевшей книге с говорящим названием «Неестественный отбор: почему гики унаследуют Землю» (Unnatural Selection: Why The Geeks Will Inherit The Earth).
К концу нулевых даже выглядеть как гик и нёрд стало из чудачества и поводов для насмешек хорошим тоном, причём в женской моде даже более, чем в мужской. Именно тогда даже в высокой моде возникает понятие «geek chiс», «гик-шик». Господствовавший до того яростный гламур с яркими цветами, золотом, леопардом и термоядерным загаром задвинули на дальние полки.
Правда, «гик-шик» как термин остался скорее достоянием любителей трендов в области моды. А в обиходе стиль и в английском, и в русском языках обычно называют «хипстерским»: из небытия всплыл и глубоко изменился термин субкультуры американских битников 50-х, обозначавший околобогемного раздолбая в странной одежде, без определённых занятий, любителя музыки и странствий.
По иронии, столь любимой хипстерами, при этом в основном обыгрывались стереотипы облика нёрдов. Огромные очки в роговых оправах, старомодные детали вроде бабочек, подтяжек, винтажных «бабушкиных» кофт и вязаных жилетов. Тщательно подобранная для имитации трогательной нелепости одежда неожиданных сочетаний и оверсайз, сиречь размером-другим больше.
Изменилась и массовая культура: в неё неудержимым потоком хлынуло многое из того, что раньше считалось достоянием гиков. Господствовавшие на экранах брутальные боевики и романтические комедии были потеснены кинокомиксами про супергероев, фэнтези, аниме и ситкомами про всё тех же гиков.
Но гик-культура — уже немного другая история и тема для отдельных статей.
▍ гики
Этимология понятия «гик» теряется в мрачных лесах древней Северной Германии и на скалистых берегах не менее древней Скандинавии. Современному английскому «geek» предшествовало диалектное английское и северонемецкое «geck», а также датское «gek».
Судя по всему, на северогерманских наречиях это изначально было подражание резким звукам, издаваемым врановыми и амфибиями: «кар, ква».
Чуть позже к нему приклеилось значение «подражать, обманывать, дурачить, издеваться, читить, троллить». Примерно так переводятся происходящие от корня «гек» глаголы: датское «gekken», немецкое «gecken», датское «gjække», шведское «gäcka». То, что делают трикстеры. Так что, можно сказать, что первыми гиками были Один и Локи.
К XVIII веку так стали называть ярмарочных шутов и фокусников из бродячих цирков. Причём по иронии судьбы и вопреки исходной семантике термина, самого свирепого рода. Не тех, кто поражал страдавшую от дефицита развлечений публику тонкими иллюзиями, мастерством рук и хитроумными скрытыми устройствами, а тех, кто её шокировал странными, пугающими и даже отвратительными вещами.
▍ нёрд
Если с «гиком» для лингвистов всё более или менее понятно, то происхождение слова «нёрд» до сих пор является предметом споров. Первое его употребление фиксируется в детской книжке в стихах «Если бы я руководил зоопарком» Доктора Сьюза 1950 года.
Там оно возникает в качестве… названия подчёркнуто несуществующего животного среди множества других из вымышленных стран. Существо «Nerd» перечислялось в ряду не менее загадочных существ It-Kutch, Preep, Proo, и все они были из некой неидентифицируемой даже приблизительно страны Ka-Troo.
На картинке – книга иллюстрирована автором – под табличкой «Nerd» находился очень мрачного и сердитого вида гуманоид, изрядно напоминающий Гринча, похитителя Рождества. Что неудивительно: Гринч и его облик точно так же вышли из-под пера Доктора Сьюза.
Книга имела широкий успех. Спустя год в одной из статей журнала Newsweek уже отмечалось, что в Детройте словечко «нёрд» стало популярным определением для людей drip and square: «туповатых и квадратных». Последний термин пришёл из джазовой и битнической среды 40-х: так в американской богеме называли консервативных обывателей, которые не понимали и не принимали джазовой культуры с её драйвом и презрением к условностям и устоям.
А вот как слово, поначалу прилипшее к не обременённым образованием обывателям, стало обозначением человека, обременённого как раз «чрезмерным» интеллектом, не совсем понятно по сей день. Однако такое употребление слова «nerd» отмечается уже спустя десять лет, в начале 1960-х годов.
Не очень достоверным, но остроумным является альтернативное возведение слова «nerd» к написанному задом наперёд слову «drunk»: «knurd», или для пущей обидности «gnurd». Так острословы из MIT, знаменитого Массачусетского технологического института, обзывали с 60-х тех интровертов, кто вместо коллективных попоек на студенческих вечеринках предпочитал одиноко сидеть с книгами.
Возможно, справедливы обе версии, и в форме «nerd» попросту слились и мрачный персонаж Доктора Сьюза, и перевёртыш студентов MIT. Как бы то ни было, к началу 70-х понятие «нёрд» стало общеупотребимым и общепонятным в американском английском.
Если русским аналогом слова «гик» в его пейоративном смысле можно назвать «задрота», то таким словом для «нёрда» будет «ботаник» или «ботан»: как правило, очень умный человек, обладающий слаборазвитыми социальными навыками, не умеющий и не любящий общаться с «обычными людьми», и однозначно предпочитающий компаниям общество книг.
Стереотипный «нёрд» одевается странновато и старомодно, часто из-за убитого постоянным чтением зрения носит большие очки с толстыми линзами. Он не придаёт особого внимания своей внешности, часто из сознательного презрения к обывательским нормам и изменчивой моде, игнорирует спорт и правильное питание, из-за чего бывает тощ или слишком полон, бледен и болезнен.
Он бывает рассеян и неряшлив, плохо разбирается в элементарных для обывателя вещах и быте – но зато может обладать огромными познаниями в какой-то узкоспециальной и обычно научной сфере, о которых может увлечённо говорить часами, в чём сближается и в ряде случаев пересекается с «гиком».
Образ «нёрда» достаточно близок к типичному «безумному учёному» вроде «Дока» Эммета Брауна. Можно даже сказать, что нёрд – это безумный учёный в молодости. Типичными примерами сферического нёрда в вакууме на российском материале можно назвать Анатолия Вассермана или Григория Перельмана.
И всё же, если гик – это про степень увлечённости какой-то околотехнической сферой, то нёрд – это больше про степень асоциальности и даже антисоциальности.
При этом нёрд, в отличие от типового гика, вполне может быть законченным гуманитарием, увлечённым, скажем, философией постструктурализма или какого-нибудь постиронического метамодерна. Ярким примером нёрда-гуманитария и при этом не-гика можно назвать Дарью Моргендорффер из одноимённого мультсериала.
В общем-то, если говорить совсем строго, то семантика понятий «гиков» и «нёрдов» более-менее устоялась только в последние лет 15. К примеру, ещё в 2007 году американская писательница Джулия Смит давала определение гика, которое сейчас определённо больше относится к нёрду: «умный молодой человек, обращённый внутрь себя, плохо социализированный, который чувствует столь слабое родство с собственной планетой, что предпочитает путешествия к мирам, придуманным любимыми авторами».
Не для новичков
Часто вам будут говорить, что от вас ничего не требуется, через пару месяцев вы станете экспертом анализа данных. Я все еще помню фразу Andrew Ng из его базового курса «Machine Learning»: «вы не обязаны знать, что такое производная, и сейчас вы разберетесь, как работают алгоритмы оптимизации в машинном обучении».
Или «вы уже почти что эксперт анализа данных» и т.д. При всем безмерном уважении к профессору — это жесткий маркетинг и желтуха. Вы не разберетесь в оптимизации без знания производных, основ матана и линейной алгебры! Скорее всего вы не станете даже Middle Data Scientist, пройдя пару курсов (включая наш).
Легко не будет, и больше половины из вас отвалится примерно на 3-4 неделе. Если вы wannabe, но не готовы с головой погрузиться в математику и программирование, видеть красоту машинного обучения в формулах и добиваться результатов, печатая десятки и сотни строк кода — вам не сюда. Но надеемся, вам все же сюда.
В связи с вышесказанным мы указываем порог вхождения — знание высшей математики на базовом (но не плохом) уровне и владение основами Python. Как подготовиться, если этого у вас пока нет, подробно описано в группе ВКонтакте и тут под спойлером, чуть ниже.
В принципе можно пройти курс и без математики, но тогда см. следующую картинку. Конечно, насколько дата саентисту нужно знать математику — это холивар, но мы тут на стороне Андрея Карпатого, Yes you should understand backprop. Ну и вообще без математики в Data Science — это почти как сортировать пузырьком: задачу, может, и решишь, но можно лучше, быстрее и умнее. Ну и без математики, конечно, не добраться до state-of-the-art, а за ним следить очень увлекательно.
Теория vs. Практика Теория и Практика
Курсов по машинному обучению полно, есть действительно классные (как специализация «Машинное обучение и анализ данных»), но многие сваливаются в одну из крайностей: либо слишком много теории (PhD guy), либо, наоборот, практика без понимания основ (data monkey).
Мы ищем оптимальное соотношение: у нас много теории в статьях на Хабре (показательна 4-я статья про линейные модели), мы пытаемся ее преподнести максимально понятно, на лекциях излагаем еще более популярно. Но и практики море — домашние задания, 4 соревнования Kaggle, проекты… и это еще не все.
Живое общение
Чего не хватает в большинстве курсов — так это живого общения. Новичкам порой нужен всего один короткий совет, чтобы сдвинуться с места и сэкономить часы, а то и десятки часов. Форумы Coursera обычно к какому-то моменту вымирают. Уникальность нашего курса — активное общение и атмосфера взаимоподдержки.
Kaggle в действии

Из паблика ВКонтакте «Мемы про машинное обучение для взрослых мужиков».
Соревнования Kaggle — отличный способ быстро прокачаться в практике анализ данных. Обычно в них начинают участвовать после прохождения базового курса машинного обучения (как правило, курса Andrew Ng, автор, безусловно, харизматичен и прекрасно рассказывает, но курс уже сильно устарел).
У нас в течение курса будет предложено поучаствовать аж в 4 соревнованиях, 2 из них — часть домашнего задания, надо просто добиться определенного результата от модели, а 2 других — уже полноценные соревнования, где надо покреативить (придумать признаки, выбрать модели) и обогнать своих товарищей.
Бесплатно
Ну тоже немаловажный фактор, чего уж там. Сейчас на волне распространения машинного обучения вы встретите немало курсов, предлагающих обучить вас за весьма кругленькую компенсацию. А тут все бесплатно и, без ложной скромности, на очень достойном уровне.
Accuracy
Интуитивно понятной, очевидной и почти неиспользуемой метрикой является accuracy — доля правильных ответов алгоритма:
Эта метрика бесполезна в задачах с неравными классами, и это легко показать на примере.
Допустим, мы хотим оценить работу спам-фильтра почты. У нас есть 100 не-спам писем, 90 из которых наш классификатор определил верно (True Negative = 90, False Positive = 10), и 10 спам-писем, 5 из которых классификатор также определил верно (True Positive = 5, False Negative = 5).Тогда accuracy:
Однако если мы просто будем предсказывать все письма как не-спам, то получим более высокую accuracy:
При этом, наша модель совершенно не обладает никакой предсказательной силой, так как изначально мы хотели определять письма со спамом. Преодолеть это нам поможет переход с общей для всех классов метрики к отдельным показателям качества классов.
Accuracy, precision и recall
Перед переходом к самим метрикам необходимо ввести важную концепцию для описания этих метрик в терминах ошибок классификации — confusion matrix (матрица ошибок).Допустим, что у нас есть два класса и алгоритм, предсказывающий принадлежность каждого объекта одному из классов, тогда матрица ошибок классификации будет выглядеть следующим образом:
Здесь
Таким образом, ошибки классификации бывают двух видов: False Negative (FN) и False Positive (FP).
X = df.drop('Churn', axis=1)
y = df['Churn']
# Делим выборку на train и test, все метрики будем оценивать на тестовом датасете
X_train, X_test, y_train, y_test = train_test_split(X, y, stratify=y, test_size=0.33, random_state=42)
# Обучаем ставшую родной логистическую регрессию
lr = LogisticRegression(random_state=42)
lr.fit(X_train, y_train)
# Воспользуемся функцией построения матрицы ошибок из документации sklearn
def plot_confusion_matrix(cm, classes, normalize=False, title='Confusion matrix', cmap=plt.cm.Blues): """ This function prints and plots the confusion matrix. Normalization can be applied by setting `normalize=True`. """ plt.imshow(cm, interpolation='nearest', cmap=cmap) plt.title(title) plt.colorbar() tick_marks = np.arange(len(classes)) plt.xticks(tick_marks, classes, rotation=45) plt.yticks(tick_marks, classes) if normalize: cm = cm.astype('float') / cm.sum(axis=1)[:, np.newaxis] print("Normalized confusion matrix") else: print('Confusion matrix, without normalization') print(cm) thresh = cm.max() / 2. for i, j in itertools.product(range(cm.shape[0]), range(cm.shape[1])): plt.text(j, i, cm[i, j], horizontalalignment="center", color="white" if cm[i, j] > thresh else "black") plt.tight_layout() plt.ylabel('True label') plt.xlabel('Predicted label')
font = {'size' : 15}
plt.rc('font', **font)
cnf_matrix = confusion_matrix(y_test, lr.predict(X_test))
plt.figure(figsize=(10, 8))
plot_confusion_matrix(cnf_matrix, classes=['Non-churned', 'Churned'], title='Confusion matrix')
plt.savefig("conf_matrix.png")
plt.show()Auc-roc и auc-pr
При конвертации вещественного ответа алгоритма (как правило, вероятности принадлежности к классу, отдельно см. SVM) в бинарную метку, мы должны выбрать какой-либо порог, при котором 0 становится 1. Естественным и близким кажется порог, равный 0.5, но он не всегда оказывается оптимальным, например, при вышеупомянутом отсутствии баланса классов.
Одним из способов оценить модель в целом, не привязываясь к конкретному порогу, является AUC-ROC (или ROC AUC) — площадь (Area Under Curve) под кривой ошибок (Receiver Operating Characteristic curve ).
TPR нам уже известна, это полнота, а FPR показывает, какую долю из объектов negative класса алгоритм предсказал неверно. В идеальном случае, когда классификатор не делает ошибок (FPR = 0, TPR = 1) мы получим площадь под кривой, равную единице; в противном случае, когда классификатор случайно выдает вероятности классов, AUC-ROC будет стремиться к 0.
5, так как классификатор будет выдавать одинаковое количество TP и FP.Каждая точка на графике соответствует выбору некоторого порога. Площадь под кривой в данном случае показывает качество алгоритма (больше — лучше), кроме этого, важной является крутизна самой кривой — мы хотим максимизировать TPR, минимизируя FPR, а значит, наша кривая в идеале должна стремиться к точке (0,1).
sns.set(font_scale=1.5)
sns.set_color_codes("muted")
plt.figure(figsize=(10, 8))
fpr, tpr, thresholds = roc_curve(y_test, lr.predict_proba(X_test)[:,1], pos_label=1)
lw = 2
plt.plot(fpr, tpr, lw=lw, label='ROC curve ')
plt.plot([0, 1], [0, 1])
plt.xlim([0.0, 1.0])
plt.ylim([0.0, 1.05])
plt.xlabel('False Positive Rate')
plt.ylabel('True Positive Rate')
plt.title('ROC curve')
plt.savefig("ROC.png")
plt.show()Критерий AUC-ROC устойчив к несбалансированным классам (спойлер: увы, не всё так однозначно) и может быть интерпретирован как вероятность того, что случайно выбранный positive объект будет проранжирован классификатором выше (будет иметь более высокую вероятность быть positive), чем случайно выбранный negative объект.
Рассмотрим следующую задачу: нам необходимо выбрать 100 релевантных документов из 1 миллиона документов. Мы намашинлернили два алгоритма:
Скорее всего, мы бы выбрали первый алгоритм, который выдает очень мало False Positive на фоне своего конкурента. Но разница в False Positive Rate между этими двумя алгоритмами крайне мала — всего 0.0019. Это является следствием того, что AUC-ROC измеряет долю False Positive относительно True Negative и в задачах, где нам не так важен второй (больший) класс, может давать не совсем адекватную картину при сравнении алгоритмов.
Для того чтобы поправить положение, вернемся к полноте и точности :
Здесь уже заметна существенная разница между двумя алгоритмами — 0.855 в точности!
Precision и recall также используют для построения кривой и, аналогично AUC-ROC, находят площадь под ней.
Здесь можно отметить, что на маленьких датасетах площадь под PR-кривой может быть чересчур оптимистична, потому как вычисляется по методу трапеций, но обычно в таких задачах данных достаточно. За подробностями о взаимоотношениях AUC-ROC и AUC-PR можно обратиться сюда.
Logistic loss
Особняком стоит логистическая функция потерь, определяемая как:
здесь
Подробно про математическую интерпретацию логистической функции потерь уже написано в рамках поста про линейные модели.Данная метрика нечасто выступает в бизнес-требованиях, но часто — в задачах на kaggle.Интуитивно можно представить минимизацию logloss как задачу максимизации accuracy путем штрафа за неверные предсказания. Однако необходимо отметить, что logloss крайне сильно штрафует за уверенность классификатора в неверном ответе.
Рассмотрим пример:
def logloss_crutch(y_true, y_pred, eps=1e-15): return - (y_true * np.log(y_pred) (1 - y_true) * np.log(1 - y_pred))
print('Logloss при неуверенной классификации %f' % logloss_crutch(1, 0.5))
>> Logloss при неуверенной классификации 0.693147
print('Logloss при уверенной классификации и верном ответе %f' % logloss_crutch(1, 0.9))
>> Logloss при уверенной классификации и верном ответе 0.105361
print('Logloss при уверенной классификации и НЕверном ответе %f' % logloss_crutch(1, 0.1))
>> Logloss при уверенной классификации и НЕверном ответе 2.302585Отметим, как драматически выросла logloss при неверном ответе и уверенной классификации!Следовательно, ошибка на одном объекте может дать существенное ухудшение общей ошибки на выборке. Такие объекты часто бывают выбросами, которые нужно не забывать фильтровать или рассматривать отдельно.Всё становится на свои места, если нарисовать график logloss:
Видно, что чем ближе к нулю ответ алгоритма при ground truth = 1, тем выше значение ошибки и круче растёт кривая.
Precision, recall и f-мера
Для оценки качества работы алгоритма на каждом из классов по отдельности введем метрики precision (точность) и recall (полнота).
Precision можно интерпретировать как долю объектов, названных классификатором положительными и при этом действительно являющимися положительными, а recall показывает, какую долю объектов положительного класса из всех объектов положительного класса нашел алгоритм.
Именно введение precision не позволяет нам записывать все объекты в один класс, так как в этом случае мы получаем рост уровня False Positive. Recall демонстрирует способность алгоритма обнаруживать данный класс вообще, а precision — способность отличать этот класс от других классов.
Как мы отмечали ранее, ошибки классификации бывают двух видов: False Positive и False Negative. В статистике первый вид ошибок называют ошибкой I-го рода, а второй — ошибкой II-го рода. В нашей задаче по определению оттока абонентов, ошибкой первого рода будет принятие лояльного абонента за уходящего, так как наша нулевая гипотеза состоит в том, что никто из абонентов не уходит, а мы эту гипотезу отвергаем. Соответственно, ошибкой второго рода будет являться «пропуск» уходящего абонента и ошибочное принятие нулевой гипотезы.
Precision и recall не зависят, в отличие от accuracy, от соотношения классов и потому применимы в условиях несбалансированных выборок.Часто в реальной практике стоит задача найти оптимальный (для заказчика) баланс между этими двумя метриками. Классическим примером является задача определения оттока клиентов.
Очевидно, что мы не можем находить всех уходящих в отток клиентов и только их. Но, определив стратегию и ресурс для удержания клиентов, мы можем подобрать нужные пороги по precision и recall. Например, можно сосредоточиться на удержании только высокодоходных клиентов или тех, кто уйдет с большей вероятностью, так как мы ограничены в ресурсах колл-центра.
Обычно при оптимизации гиперпараметров алгоритма (например, в случае перебора по сетке GridSearchCV ) используется одна метрика, улучшение которой мы и ожидаем увидеть на тестовой выборке.
Существует несколько различных способов объединить precision и recall в агрегированный критерий качества. F-мера (в общем случае
F-мера достигает максимума при полноте и точности, равными единице, и близка к нулю, если один из аргументов близок к нулю.
В sklearn есть удобная функция _metrics.classificationreport, возвращающая recall, precision и F-меру для каждого из классов, а также количество экземпляров каждого класса.
report = classification_report(y_test, lr.predict(X_test), target_names=['Non-churned', 'Churned'])
print(report)Здесь необходимо отметить, что в случае задач с несбалансированными классами, которые превалируют в реальной практике, часто приходится прибегать к техникам искусственной модификации датасета для выравнивания соотношения классов. Их существует много, и мы не будем их касаться, здесь можно посмотреть некоторые методы и выбрать подходящий для вашей задачи.
Благодарности
Спасибо mephistopheies и madrugado за помощь в подготовке статьи.
Гбпоу рк романовский колледж индустрии гостеприимства (ркиг)
ГОСУДАРСТВЕННОЕ
БЮДЖЕТНОЕ ПРОФЕССИОНАЛЬНОЕ ОБРАЗОВАТЕЛЬНОЕ
УЧРЕЖДЕНИЕ РЕСПУБЛИКИ КРЫМ
«РОМАНОВСКИЙ КОЛЛЕДЖ ИНДУСТРИИ
ГОСТЕПРИИМСТВА»
Лицензия на осуществление
образовательной деятельности №0679 от
15.08.2022 г.
295000, Россия, Республика Крым, г.
Симферополь, ул. Дыбенко, 14. тел. (3652)
27-00-38, (3652) 60-03-78
http://rasshifrui.ru
Государственное
бюджетное профессиональное образовательное учреждение
«Романовский колледж индустрии гостеприимства» (ГБПОУ
РК «РКИГ», бывшее Симферопольское высшее профессиональное
училище ресторанного сервиса и туризма) – ведущее
профессиональное образовательное учреждение Республики
Крым, основанное в декабре 1954 года. Учредителем
Учреждения и собственником его имущества является
Республика Крым. Функции и полномочия учредителя
учреждения в соответствии с законодательством Российской
Федерации и законодательством Республики Крым осуществляетМинистерство
образования, науки и молодежи Республики Крым
В стенах головного образовательного учреждения ежегодно
обучается более 700 студентов; работает более 80
сотрудников, из которых 70% педагогов имеют высшую
и первую категории. Обучение студентов проводится
в современных аудиториях, учебно-производственных
лабораториях. Колледж имеет 24 специализированных
и 4 компьютерных кабинета, подключенных к сети Интернет;
Информационный библиотечный центр (ИБЦ), 2 конференц-зала;
учебные бар и ресторан; лаборатории «Гостиничный
номер» и «Ресепшн»; 3 кухни-лаборатории, оснащенные
современным оборудованием. Организовано питание
обучающихся (в. т.ч. сирот и малообеспеченных) в
студенческой столовой. Колледж осуществляет экспериментально-исследовательскую
деятельность.
Ведет
работу кружок самодеятельности «Театр миниатюр»,
физкультурно-спортивные секции «Лёгкая атлетика»,
«Общефизическая подготовка», занятия проходят в
гимнастическом зале, тренажерном зале на спортивных
площадках стадиона «Фиолент» и школы-гимназии №1.
Студенты
колледжа получают медицинское обслуживание в
3-ей поликлинике г. Симферополь.
ГБПОУ РК «РКИГ» имеет третий аттестационный уровень,
включает в себя два филиала – в Алуште и Судаке.
Алуштинский филиал осуществляет образовательную
деятельность по профессиям: «Повар; кондитер»; «Продавец;
контролёр-кассир»; имеет современную материально-техническую
базу: библиотеку, 11 учебных и 1 компьютерный кабинет,
3 учебные мастерские, актовый зал, буфет. Контингент
обучающихся составляет 157 человек, 30 сотрудников.
Образовательный уровень: квалифицированный рабочий,
служащий.
Судакский
филиал готовит квалифицированных работников по профессии:
«Официант, бармен», «Повар, кондитер», имеет современную
материально-техническую базу, библиотеку с читальным
залом на 20 мест, буфет, 1 компьютерный и 8 учебных
кабинетов, учебные лаборатории профессионального
образования «Повар»; «Кондитер». В филиале работают
кружки: «Краеведение», «Вдохновение», «Творческая
мастерская». Контингент студентов составляет 96
человек, сотрудников- 26.
Мощным
интеллектуальным компонентом информационной инфраструктуры
колледжа является Информационный библиотечный центр,
основной целью создания которого стало содействие
повышению качества образования посредством доступа
педагогов и студентов к максимально полной информации
на традиционных и электронных носителях.
ИБЦ
характеризуется динамичным формированием традиционной
и электронной среды, внедрением и активизацией использования
информационных компьютерных технологий (ИКТ) в учебном
заведении. В состав центра вошли библиотека, лаборатории
«Коммуникационные технологии», «Интерактивное обучение».
Форма
обучения в РКИГ– дневная,
язык обучения – русский. Студентам
начисляется стипендия на общих основаниях. Выпускникам
вручаются дипломы государственного образца.
Обучение студентов проводится в современных аудиториях,
учебно-производственных лабораториях.
Приём
документов – с 1
июня по 15 августа
Начало
занятий – 1 сентября
Полное
название учебного заведения: Государственное
бюджетное профессиональное образовательное учреждение
Республики Крым «Романовский колледж индустрии гостеприимства»
Адрес учебного заведения:
295000, Россия, Республика Крым, г.
Симферополь, ул. Дыбенко, 14
Тел./факс:
73652270038
Тел.: 73652274218,
73652600378
Е-mail:
043@crimeaedu.ru
Сайт:http://rasshifrui.ru
Директор
— Пальчук Марина Ивановна 
– тел. 73652270038.
Зам.
директора по безопасности — Моцарь Олег Александрович

– тел. 73652600378.
Зам.
директора по учебно-производственной работе — Булаш
Елена Шаликовна
– тел. 73652600378.
Зам.
директора по учебно-воспитательной работе — Солопова
Татьяна Леонидовна
– тел. 73652600378.
Заведующий
отделением подготовки «Поварское и
кондитерское дело», «Организация
обслуживания в общественном питании» —
Аблаева Лейля Энверовна
– тел. 73652600378.
Заведующий
отделением подготовки «Гостиничное
дело», «Туризм» — Сафонова Татьяна
Ивановна
–
тел. 73652600378.
Заведующий
центром развития профессиональных
компетенций — Волкова Анна Юрьевна
–
тел. 73652601901.
Дежурный
по колледжу – тел. 73652270038.
ЧАСЫ
РАБОТЫ
Понедельник-пятница
8:00 — 17:00
Выходные
дни: Суббота, Воскресенье
Как
нас найти
От
железнодорожного вокзала: троллейбус № 5, 6, 9, маршрутное
такси № 57, 98, 36, 89, 50, 60, 112, остановка «Гимназия
№ 1».
От
автостанции Западная: маршрутное такси № 89, 36 остановка
«Железнодорожный техникум».
От
Центрального автовокзала: троллейбус № 6, маршрутное
такси № 85, 60, 49 остановка «Главпочтамт».
От
автостанции Восточная: маршрутное такси № 78, 36,
51, 62 остановка «Главпочтамт», «Железнодорожный техникум».
Материалы курса
Здесь мы вкратце опишем 10 тем курса, чему они посвящены, почему без них не может обойтись курс базового машинного обучения, и что нового мы внесли.
Тема 1. Первичный анализ данных с Pandas. Статья на Хабре

Тема 2. Визуальный анализ данных c Python. Статья на Хабре

Тема 3. Классификация, деревья решений и метод ближайших соседей.Статья на Хабре

Тема 4. Линейные модели классификации и регрессии.Статья на Хабре
задаче идентификации пользователя по последовательности посещенных сайтов. После четвертого домашнего задания отсеется много народу, но если вы его все-таки сделаете, то будете иметь уже очень неплохое представление о том, какие алгоритмы используются в production-системах.
Тема 5. Композиции: бэггинг, случайный лес. Статья на Хабре

Тема 6. Построение и отбор признаков. Приложения в задачах обработки текста, изображений и геоданных. Статья на Хабре, лекция про регрессию и регуляризацию.

На лекции опять обсудим линейные модели, а также основную технику настройки сложности ML-моделей — регуляризацию. В книге «Deep Learning» даже ссылаются на одного известного товарища (лень лезть за пруф-линком), который утверждает, что вообще «все машинное обучение — суть регуляризация».
Тема 7. Обучение без учителя: PCA, кластеризация. Статья на Хабре
неразмеченных данных пруд пруди, и надо уметь и из них извлекать пользу. Мы обсудим только 2 типа задач — кластеризацию и снижение размерности. В домашнем задании вы будете анализировать данные с акселерометров и гироскопов мобильных телефонов и пытаться по ним кластеризовать носителей телефонов, выделять типы активностей.
Тема 8. Обучение на гигабайтах c Vowpal Wabbit. Статья на Хабре
перевод именно этой статьи (в виде Kaggle Kernel) служит примером того, как мы будем подавать материал на английском на Medium.
Тема 9. Анализ временных рядов с помощью Python. Статья на Хабре

Тема 10. Градиентный бустинг. Статья на Хабре
Подробнее о новом запуске
Курс стартует 5 февраля 2022 года. В течение курса будут:
Полезные ссылки
- Курс Евгения Соколова: Семинар по выбору моделей (там есть информация по метрикам задач регрессии)
- Задачки на AUC-ROC от А.Г. Дьяконова
- Дополнительно о других метриках можно почитать на kaggle. К описанию каждой метрики добавлена ссылка на соревнования, где она использовалась
- Презентация Богдана Мельника aka ld86 про обучение на несбалансированных выборках


