<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ru">
	<id>http://digida.mgpu.ru/index.php?action=history&amp;feed=atom&amp;title=R-%D1%81%D0%BA%D1%80%D0%B8%D0%BF%D1%82_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%A8%D0%B8%D1%88%D0%BA%D0%BE%D0%B2%D0%B0_%D0%94%D0%B0%D1%80%D1%8C%D1%8F</id>
	<title>R-скрипт анализ Шишкова Дарья - История изменений</title>
	<link rel="self" type="application/atom+xml" href="http://digida.mgpu.ru/index.php?action=history&amp;feed=atom&amp;title=R-%D1%81%D0%BA%D1%80%D0%B8%D0%BF%D1%82_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%A8%D0%B8%D1%88%D0%BA%D0%BE%D0%B2%D0%B0_%D0%94%D0%B0%D1%80%D1%8C%D1%8F"/>
	<link rel="alternate" type="text/html" href="http://digida.mgpu.ru/index.php?title=R-%D1%81%D0%BA%D1%80%D0%B8%D0%BF%D1%82_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%A8%D0%B8%D1%88%D0%BA%D0%BE%D0%B2%D0%B0_%D0%94%D0%B0%D1%80%D1%8C%D1%8F&amp;action=history"/>
	<updated>2026-08-14T20:24:11Z</updated>
	<subtitle>История изменений этой страницы в вики</subtitle>
	<generator>MediaWiki 1.44.0</generator>
	<entry>
		<id>http://digida.mgpu.ru/index.php?title=R-%D1%81%D0%BA%D1%80%D0%B8%D0%BF%D1%82_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%A8%D0%B8%D1%88%D0%BA%D0%BE%D0%B2%D0%B0_%D0%94%D0%B0%D1%80%D1%8C%D1%8F&amp;diff=47865&amp;oldid=prev</id>
		<title>Daria Shishkova: Новая страница: «== Описание датасета == Для анализа был выбран датасет &#039;&#039;&#039;Food&#039;&#039;&#039;, находящийся в категории Dataset. Этот датасет содержит данные о различных блюдах и витаминах и минералах, которые в них содержатся. Ссылка на датасет: [https://corgis-edu.github.io/corgis/datasets/csv/food/food.csv]  == R-скрипт...»</title>
		<link rel="alternate" type="text/html" href="http://digida.mgpu.ru/index.php?title=R-%D1%81%D0%BA%D1%80%D0%B8%D0%BF%D1%82_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%A8%D0%B8%D1%88%D0%BA%D0%BE%D0%B2%D0%B0_%D0%94%D0%B0%D1%80%D1%8C%D1%8F&amp;diff=47865&amp;oldid=prev"/>
		<updated>2026-06-15T16:26:36Z</updated>

		<summary type="html">&lt;p&gt;Новая страница: «== Описание датасета == Для анализа был выбран датасет &amp;#039;&amp;#039;&amp;#039;Food&amp;#039;&amp;#039;&amp;#039;, находящийся в категории Dataset. Этот датасет содержит данные о различных блюдах и витаминах и минералах, которые в них содержатся. Ссылка на датасет: [https://corgis-edu.github.io/corgis/datasets/csv/food/food.csv]  == R-скрипт...»&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Новая страница&lt;/b&gt;&lt;/p&gt;&lt;div&gt;== Описание датасета ==&lt;br /&gt;
Для анализа был выбран датасет &amp;#039;&amp;#039;&amp;#039;Food&amp;#039;&amp;#039;&amp;#039;, находящийся в категории Dataset. Этот датасет содержит данные о различных блюдах и витаминах и минералах, которые в них содержатся.&lt;br /&gt;
Ссылка на датасет: [https://corgis-edu.github.io/corgis/datasets/csv/food/food.csv]&lt;br /&gt;
&lt;br /&gt;
== R-скрипт для вывода 10 наиболее встречаемых слов ==&lt;br /&gt;
&amp;lt;syntaxhighlight lang=&amp;quot;R&amp;quot; line&amp;gt;&lt;br /&gt;
library(tidyverse)&lt;br /&gt;
&lt;br /&gt;
data &amp;lt;- read_csv(&amp;quot;https://corgis-edu.github.io/corgis/datasets/csv/food/food.csv&amp;quot;)&lt;br /&gt;
&lt;br /&gt;
glimpse(data)&lt;br /&gt;
&lt;br /&gt;
# Чтение всех текстовых колонок &lt;br /&gt;
all_text &amp;lt;- data %&amp;gt;%&lt;br /&gt;
  select(where(is.character)) %&amp;gt;% &lt;br /&gt;
  unite(&amp;quot;all_text&amp;quot;, everything(), sep = &amp;quot; &amp;quot;, na.rm = TRUE) %&amp;gt;%&lt;br /&gt;
  pull(all_text)&lt;br /&gt;
&lt;br /&gt;
# Разбивка на слова&lt;br /&gt;
words &amp;lt;- str_split(all_text, &amp;quot; &amp;quot;) %&amp;gt;%&lt;br /&gt;
  unlist() %&amp;gt;%&lt;br /&gt;
  str_replace_all(&amp;quot;[^A-Za-z]&amp;quot;, &amp;quot;&amp;quot;) %&amp;gt;%&lt;br /&gt;
  tolower() %&amp;gt;%&lt;br /&gt;
  .[. != &amp;quot;&amp;quot;]&lt;br /&gt;
&lt;br /&gt;
# Общее количество слов в корпусе&lt;br /&gt;
total_words &amp;lt;- length(words)&lt;br /&gt;
print(paste(&amp;quot;Всего слов:&amp;quot;, total_words))&lt;br /&gt;
&lt;br /&gt;
# 10 самых частых слов, связанных с едой&lt;br /&gt;
top10_words &amp;lt;- as.data.frame(sort(table(words), decreasing = TRUE)[1:10])&lt;br /&gt;
colnames(top10_words) &amp;lt;- c(&amp;quot;Слово из датасета&amp;quot;, &amp;quot;Сколько раз встречается&amp;quot;)&lt;br /&gt;
print(top10_words)&lt;br /&gt;
&amp;lt;/syntaxhighlight&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Результаты поиска 10 наиболее встречаемых слов ===&lt;br /&gt;
[[Файл:Результат 10 наиболее встречаемых слов.png|мини]]&lt;br /&gt;
В результате мы видим, что чаще всего в датасете встречаются союзы (with, or, and), остальные позиции занимает еда, известная всем (chicken, sauce, cheese, vegetables, sandwich). Также есть 2 слова, которые не относятся ни к одной из этих категорий (fat, added).&lt;br /&gt;
&lt;br /&gt;
== Вывод ==&lt;br /&gt;
Благодаря языку R и RStudio мы можем анализировать большие тексты и определять часто встречающиеся слова для дальнейшей работы (создание диаграмм или опросов, к примеру).&lt;br /&gt;
&lt;br /&gt;
[[Категория:CompLing Works]]&lt;/div&gt;</summary>
		<author><name>Daria Shishkova</name></author>
	</entry>
</feed>