Участник:Vakhrushevavs521/R lesson: различия между версиями
Материал из Поле цифровой дидактики
Patarakin (обсуждение | вклад) Новая страница: «Здесь будет пример кода на языке R» |
Нет описания правки |
||
| (не показано 6 промежуточных версий 2 участников) | |||
| Строка 1: | Строка 1: | ||
Видоизмененный код урока на языке R [[Как изучить данные PISA learningtower package]], добавлены новые страны и произведена визуализация результатов | |||
[[Файл:Средние взвешенные баллы PISA 2015.png | 600px]] | |||
<syntaxhighlight lang="R" line> | |||
getwd() | |||
#------------ | |||
library(learningtower); | |||
library(dplyr) | |||
library(ggplot2) | |||
#---- | |||
student_data_2015 <- load_student(2015) | |||
student_data_2012 <- load_student(2012) | |||
str(student_data_2015) | |||
glimpse(student_data_2015) | |||
summary(student_data_2015) | |||
glimpse(student_data_2015) | |||
data_proc <- student_data_2015 %>% | |||
filter(country %in% c("RUS", "USA", "SGP", "AUS", "CRI", "CZE")) %>% | |||
group_by(country, gender) %>% | |||
summarise( | |||
mean_math = weighted.mean(math, stu_wgt, na.rm = TRUE), | |||
mean_science = weighted.mean(science, stu_wgt, na.rm = TRUE), | |||
n = n(), | |||
.groups = "drop" | |||
) %>% | |||
na.omit() | |||
print(data_proc) | |||
ggplot(student_data_2015 %>% filter(country %in% c("RUS", "USA", "SGP", "AUS", "CRI", "CZE")), | |||
aes(x = country, y = math, fill = gender)) + | |||
geom_boxplot(alpha = 0.7) + | |||
labs(title = "Распределение баллов по математике (PISA 2015)", | |||
x = "Страна", y = "Баллы по математике", fill = "Пол") + | |||
theme_minimal() + | |||
theme(legend.position = "bottom") | |||
#---- | |||
ggplot(student_data_2012 %>% filter(country %in% c("RUS", "USA", "SGP", "AUS", "CRI", "CZE")), | |||
aes(x = country, y = math, fill = gender)) + | |||
geom_boxplot(alpha = 0.7) + | |||
labs(title = "Распределение баллов по математике (PISA 2012)", | |||
x = "Страна", y = "Баллы по математике", fill = "Пол") + | |||
theme_minimal() + | |||
theme(legend.position = "bottom") | |||
##--- | |||
data_long <- data_proc %>% | |||
tidyr::pivot_longer(cols = starts_with("mean_"), names_to = "subject", values_to = "score") %>% | |||
mutate(subject = recode(subject, "mean_math" = "Математика", "mean_science" = "Наука")) | |||
ggplot(data_long, aes(x = country, y = score, fill = gender)) + | |||
geom_col(position = "dodge") + | |||
facet_wrap(~ subject) + | |||
labs(title = "Средние взвешенные баллы PISA 2015", | |||
x = "Страна", y = "Средний балл", fill = "Пол") + | |||
theme_minimal() + | |||
theme(legend.position = "bottom") | |||
</syntaxhighlight> | |||
== Основные глаголы преобразования данных == | |||
{{Шаблон:TidyR}} | |||
[[Категория:Lesson]] | |||
Текущая версия от 18:21, 9 октября 2026
Видоизмененный код урока на языке R Как изучить данные PISA learningtower package, добавлены новые страны и произведена визуализация результатов
getwd()
#------------
library(learningtower);
library(dplyr)
library(ggplot2)
#----
student_data_2015 <- load_student(2015)
student_data_2012 <- load_student(2012)
str(student_data_2015)
glimpse(student_data_2015)
summary(student_data_2015)
glimpse(student_data_2015)
data_proc <- student_data_2015 %>%
filter(country %in% c("RUS", "USA", "SGP", "AUS", "CRI", "CZE")) %>%
group_by(country, gender) %>%
summarise(
mean_math = weighted.mean(math, stu_wgt, na.rm = TRUE),
mean_science = weighted.mean(science, stu_wgt, na.rm = TRUE),
n = n(),
.groups = "drop"
) %>%
na.omit()
print(data_proc)
ggplot(student_data_2015 %>% filter(country %in% c("RUS", "USA", "SGP", "AUS", "CRI", "CZE")),
aes(x = country, y = math, fill = gender)) +
geom_boxplot(alpha = 0.7) +
labs(title = "Распределение баллов по математике (PISA 2015)",
x = "Страна", y = "Баллы по математике", fill = "Пол") +
theme_minimal() +
theme(legend.position = "bottom")
#----
ggplot(student_data_2012 %>% filter(country %in% c("RUS", "USA", "SGP", "AUS", "CRI", "CZE")),
aes(x = country, y = math, fill = gender)) +
geom_boxplot(alpha = 0.7) +
labs(title = "Распределение баллов по математике (PISA 2012)",
x = "Страна", y = "Баллы по математике", fill = "Пол") +
theme_minimal() +
theme(legend.position = "bottom")
##---
data_long <- data_proc %>%
tidyr::pivot_longer(cols = starts_with("mean_"), names_to = "subject", values_to = "score") %>%
mutate(subject = recode(subject, "mean_math" = "Математика", "mean_science" = "Наука"))
ggplot(data_long, aes(x = country, y = score, fill = gender)) +
geom_col(position = "dodge") +
facet_wrap(~ subject) +
labs(title = "Средние взвешенные баллы PISA 2015",
x = "Страна", y = "Средний балл", fill = "Пол") +
theme_minimal() +
theme(legend.position = "bottom")
Основные глаголы преобразования данных
| Функция | Что делает | С чем работает | Простой пример (R) |
|---|---|---|---|
select()
|
Выбирает (оставляет) нужные столбцы датафрейма; остальные отбрасывает. | Столбцы (переменные) | students |>
select(username, n_total_edits, discipline)
|
filter()
|
Оставляет строки, которые удовлетворяют логическому условию (фильтрация наблюдений). | Строки (наблюдения) | students |>
filter(n_total_edits > 50, discipline == "Филология")
|
mutate()
|
Добавляет новые столбцы или изменяет существующие, вычисляя их из других переменных. | Столбцы (новые или изменённые переменные) | students |>
mutate(
edit_per_day = n_total_edits / days_active,
pct_articles = edits_articles / n_total_edits * 100
)
|
group_by()
|
Задаёт группировку по одной или нескольким переменным; изменяет "структуру вычислений", но не сами данные. | Группы строк (по категориям) | students |>
group_by(discipline)
|
summarise()
|
Строит сводку по группам: сворачивает много строк в одну строку на группу (средние, суммы и т.п.). | Группы (после group_by())
|
students |>
group_by(discipline) |>
summarise(
mean_edits = mean(n_total_edits, na.rm = TRUE),
n_students = n()
)
|
