<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ru">
	<id>http://digida.mgpu.ru/index.php?action=history&amp;feed=atom&amp;title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0_R_%D0%9F%D0%B5%D1%82%D1%80%D0%BE%D0%B2%D0%B0_%D0%A3%D0%BB%D1%8C%D1%8F%D0%BD%D0%B0_%D0%9F%D0%B0%D0%B2%D0%BB%D0%BE%D0%B2%D0%BD%D0%B0</id>
	<title>Описательная статистика R Петрова Ульяна Павловна - История изменений</title>
	<link rel="self" type="application/atom+xml" href="http://digida.mgpu.ru/index.php?action=history&amp;feed=atom&amp;title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0_R_%D0%9F%D0%B5%D1%82%D1%80%D0%BE%D0%B2%D0%B0_%D0%A3%D0%BB%D1%8C%D1%8F%D0%BD%D0%B0_%D0%9F%D0%B0%D0%B2%D0%BB%D0%BE%D0%B2%D0%BD%D0%B0"/>
	<link rel="alternate" type="text/html" href="http://digida.mgpu.ru/index.php?title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0_R_%D0%9F%D0%B5%D1%82%D1%80%D0%BE%D0%B2%D0%B0_%D0%A3%D0%BB%D1%8C%D1%8F%D0%BD%D0%B0_%D0%9F%D0%B0%D0%B2%D0%BB%D0%BE%D0%B2%D0%BD%D0%B0&amp;action=history"/>
	<updated>2026-10-10T04:19:13Z</updated>
	<subtitle>История изменений этой страницы в вики</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>http://digida.mgpu.ru/index.php?title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0_R_%D0%9F%D0%B5%D1%82%D1%80%D0%BE%D0%B2%D0%B0_%D0%A3%D0%BB%D1%8C%D1%8F%D0%BD%D0%B0_%D0%9F%D0%B0%D0%B2%D0%BB%D0%BE%D0%B2%D0%BD%D0%B0&amp;diff=47913&amp;oldid=prev</id>
		<title>Петрова Ульяна: Новая страница: «== Использование R в описательной статистике и визуализации == Расширяем анализ subjects из предыдущего раздела: считаем лексическое  разнообразие (TTR), топ-20 слов и топ-15 биграмм.  === Код программы === &lt;syntaxhighlight lang=&quot;R&quot; line&gt; library(tidyverse) library(tidytext) library(ggplot2)  # classics_subj уже...»</title>
		<link rel="alternate" type="text/html" href="http://digida.mgpu.ru/index.php?title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0_R_%D0%9F%D0%B5%D1%82%D1%80%D0%BE%D0%B2%D0%B0_%D0%A3%D0%BB%D1%8C%D1%8F%D0%BD%D0%B0_%D0%9F%D0%B0%D0%B2%D0%BB%D0%BE%D0%B2%D0%BD%D0%B0&amp;diff=47913&amp;oldid=prev"/>
		<updated>2026-06-15T21:58:06Z</updated>

		<summary type="html">&lt;p&gt;Новая страница: «== Использование R в описательной статистике и визуализации == Расширяем анализ subjects из предыдущего раздела: считаем лексическое  разнообразие (TTR), топ-20 слов и топ-15 биграмм.  === Код программы === &amp;lt;syntaxhighlight lang=&amp;quot;R&amp;quot; line&amp;gt; library(tidyverse) library(tidytext) library(ggplot2)  # classics_subj уже...»&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Новая страница&lt;/b&gt;&lt;/p&gt;&lt;div&gt;== Использование R в описательной статистике и визуализации ==&lt;br /&gt;
Расширяем анализ subjects из предыдущего раздела: считаем лексическое &lt;br /&gt;
разнообразие (TTR), топ-20 слов и топ-15 биграмм.&lt;br /&gt;
&lt;br /&gt;
=== Код программы ===&lt;br /&gt;
&amp;lt;syntaxhighlight lang=&amp;quot;R&amp;quot; line&amp;gt;&lt;br /&gt;
library(tidyverse)&lt;br /&gt;
library(tidytext)&lt;br /&gt;
library(ggplot2)&lt;br /&gt;
&lt;br /&gt;
# classics_subj уже загружен из предыдущего шага&lt;br /&gt;
tokens &amp;lt;- classics_subj %&amp;gt;%&lt;br /&gt;
  select(bibliography.subjects) %&amp;gt;%&lt;br /&gt;
  unnest_tokens(word, bibliography.subjects) %&amp;gt;%&lt;br /&gt;
  anti_join(stop_words, by = &amp;quot;word&amp;quot;) %&amp;gt;%&lt;br /&gt;
  filter(!str_detect(word, &amp;quot;^[0-9]+$&amp;quot;))&lt;br /&gt;
&lt;br /&gt;
# Type-Token Ratio&lt;br /&gt;
total_words &amp;lt;- nrow(tokens)&lt;br /&gt;
unique_words &amp;lt;- n_distinct(tokens$word)&lt;br /&gt;
tt_ratio &amp;lt;- unique_words / total_words * 100&lt;br /&gt;
&lt;br /&gt;
cat(&amp;quot;Всего слов:&amp;quot;, total_words, &amp;quot;\n&amp;quot;)&lt;br /&gt;
cat(&amp;quot;Уникальных слов:&amp;quot;, unique_words, &amp;quot;\n&amp;quot;)&lt;br /&gt;
cat(&amp;quot;Type-Token Ratio:&amp;quot;, round(tt_ratio, 2), &amp;quot;%\n\n&amp;quot;)&lt;br /&gt;
&lt;br /&gt;
# Топ-20 слов&lt;br /&gt;
word_freq &amp;lt;- tokens %&amp;gt;% count(word, sort = TRUE)&lt;br /&gt;
print(word_freq %&amp;gt;% head(20))&lt;br /&gt;
&lt;br /&gt;
p1 &amp;lt;- ggplot(word_freq %&amp;gt;% head(20), aes(x = reorder(word, n), y = n)) +&lt;br /&gt;
  geom_col(fill = &amp;quot;steelblue&amp;quot;) +&lt;br /&gt;
  coord_flip() +&lt;br /&gt;
  labs(title = &amp;quot;Топ-20 слов в жанровых тегах (subjects)&amp;quot;,&lt;br /&gt;
       x = &amp;quot;Слово&amp;quot;, y = &amp;quot;Частота&amp;quot;) +&lt;br /&gt;
  theme_minimal()&lt;br /&gt;
print(p1)&lt;br /&gt;
&lt;br /&gt;
# Топ-15 биграмм&lt;br /&gt;
bigrams &amp;lt;- classics_subj %&amp;gt;%&lt;br /&gt;
  unnest_tokens(bigram, bibliography.subjects, token = &amp;quot;ngrams&amp;quot;, n = 2) %&amp;gt;%&lt;br /&gt;
  separate(bigram, c(&amp;quot;word1&amp;quot;, &amp;quot;word2&amp;quot;), sep = &amp;quot; &amp;quot;) %&amp;gt;%&lt;br /&gt;
  filter(!is.na(word1), !is.na(word2)) %&amp;gt;%&lt;br /&gt;
  filter(!word1 %in% stop_words$word,&lt;br /&gt;
         !word2 %in% stop_words$word) %&amp;gt;%&lt;br /&gt;
  count(word1, word2, sort = TRUE)&lt;br /&gt;
&lt;br /&gt;
print(bigrams %&amp;gt;% head(15))&lt;br /&gt;
&lt;br /&gt;
p2 &amp;lt;- bigrams %&amp;gt;%&lt;br /&gt;
  head(15) %&amp;gt;%&lt;br /&gt;
  unite(bigram, word1, word2, sep = &amp;quot; &amp;quot;) %&amp;gt;%&lt;br /&gt;
  ggplot(aes(x = reorder(bigram, n), y = n)) +&lt;br /&gt;
  geom_col(fill = &amp;quot;coral&amp;quot;) +&lt;br /&gt;
  coord_flip() +&lt;br /&gt;
  labs(title = &amp;quot;Топ-15 биграмм в subjects&amp;quot;, x = &amp;quot;Биграмма&amp;quot;, y = &amp;quot;Частота&amp;quot;) +&lt;br /&gt;
  theme_minimal()&lt;br /&gt;
print(p2)&lt;br /&gt;
&amp;lt;/syntaxhighlight&amp;gt;&lt;br /&gt;
&lt;br /&gt;
[[Файл:Снимок 16.06.2026 в 00.53.jpeg|400px|thumb|center|Код R-скрипта в RStudio (posit.cloud)]]&lt;br /&gt;
&lt;br /&gt;
=== Вывод программы ===&lt;br /&gt;
&amp;lt;pre&amp;gt;&lt;br /&gt;
Всего слов: 8021 &lt;br /&gt;
Уникальных слов: 1418 &lt;br /&gt;
Type-Token Ratio: 17.68 %&lt;br /&gt;
&lt;br /&gt;
# A tibble: 20 × 2&lt;br /&gt;
   word             n&lt;br /&gt;
   &amp;lt;chr&amp;gt;        &amp;lt;int&amp;gt;&lt;br /&gt;
 1 fiction       1415&lt;br /&gt;
 2 stories        212&lt;br /&gt;
 3 drama          206&lt;br /&gt;
 4 english         178&lt;br /&gt;
 5 england         155&lt;br /&gt;
 6 poetry          133&lt;br /&gt;
 7 history         129&lt;br /&gt;
 8 life            104&lt;br /&gt;
 9 character        95&lt;br /&gt;
10 century          90&lt;br /&gt;
11 translations     87&lt;br /&gt;
12 social           84&lt;br /&gt;
13 fictitious       77&lt;br /&gt;
14 women            73&lt;br /&gt;
15 united           68&lt;br /&gt;
16 tales            65&lt;br /&gt;
17 biography        61&lt;br /&gt;
18 science          61&lt;br /&gt;
19 customs          53&lt;br /&gt;
20 american         48&lt;br /&gt;
&lt;br /&gt;
# A tibble: 15 × 3&lt;br /&gt;
   word1         word2         n&lt;br /&gt;
   &amp;lt;chr&amp;gt;         &amp;lt;chr&amp;gt;     &amp;lt;int&amp;gt;&lt;br /&gt;
 1 england       fiction     110&lt;br /&gt;
 2 fictitious    character    75&lt;br /&gt;
 3 character     fiction      67&lt;br /&gt;
 4 social        life         50&lt;br /&gt;
 5 short         stories      47&lt;br /&gt;
 6 19th          century      46&lt;br /&gt;
 7 science       fiction      39&lt;br /&gt;
 8 women         fiction      39&lt;br /&gt;
 9 fiction       england      38&lt;br /&gt;
10 juvenile      fiction      38&lt;br /&gt;
11 psychological fiction      37&lt;br /&gt;
12 century       fiction      36&lt;br /&gt;
13 domestic      fiction      36&lt;br /&gt;
14 love          stories      36&lt;br /&gt;
15 fiction       love         35&lt;br /&gt;
&amp;lt;/pre&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Выводы расширенного анализа ==&lt;br /&gt;
Лексическое разнообразие тегов subjects низкое (TTR = 17.68%) — ожидаемо, &lt;br /&gt;
так как subjects не свободный текст, а стандартизованные рубрики Library &lt;br /&gt;
of Congress, и одни и те же слова повторяются из книги в книгу.&lt;br /&gt;
&lt;br /&gt;
В топ-20 после ядра &amp;quot;fiction/stories/drama/english/england&amp;quot; видны вторичные &lt;br /&gt;
темы: переводная литература (translations), социальный аспект (social, &lt;br /&gt;
customs), пол персонажей (women), география (united/american vs england/&lt;br /&gt;
english) и science (как часть &amp;quot;science fiction&amp;quot;).&lt;br /&gt;
&lt;br /&gt;
Биграммы в основном — фрагменты составных рубрик: &amp;quot;fictitious character&amp;quot; &lt;br /&gt;
и &amp;quot;19th century&amp;quot; — это части стандартных заголовков LCSH, а не свободные &lt;br /&gt;
словосочетания. Из реальных поджанров видны short stories, love stories, &lt;br /&gt;
science fiction, domestic fiction, psychological fiction, juvenile fiction.&lt;br /&gt;
&lt;br /&gt;
[[Категория:CompLing Works]]&lt;/div&gt;</summary>
		<author><name>Петрова Ульяна</name></author>
	</entry>
</feed>