本日の流れ

  1. 復習(前半):第8〜11回の推測統計のポイントを確認
  2. 習熟度確認テスト(後半):RStudio を使って課題に取り組む

復習:推測統計のまとめ

分析方法の選び方

比較・分析したいもの 使う検定
2変数の直線的関係(両方連続) 相関分析(cor.test()
2つのカテゴリ変数の関連 カイ二乗検定(chisq.test()
独立した2群の平均値の差 独立2標本t検定(t.test()
同一人の2時点の差 対応のあるt検定(t.test(..., paired=TRUE)
3群以上の平均値の差 分散分析(第13〜14回)

相関分析(第8回)の復習

cor.test(iris$Sepal.Length, iris$Petal.Length)
## 
##  Pearson's product-moment correlation
## 
## data:  iris$Sepal.Length and iris$Petal.Length
## t = 21.646, df = 148, p-value < 2.2e-16
## alternative hypothesis: true correlation is not equal to 0
## 95 percent confidence interval:
##  0.8270363 0.9055080
## sample estimates:
##       cor 
## 0.8717538

報告例r(148) = .87, p < .001


カイ二乗検定(第9回)の復習

tab <- table(mtcars$cyl, mtcars$am)
chisq.test(tab)
## 
##  Pearson's Chi-squared test
## 
## data:  tab
## X-squared = 8.7407, df = 2, p-value = 0.01265

報告例:χ²(2, N = 32) = ○○, p = ○○


独立t検定(第10回)の復習

t.test(mpg ~ am, data = mtcars)
## 
##  Welch Two Sample t-test
## 
## data:  mpg by am
## t = -3.7671, df = 18.332, p-value = 0.001374
## alternative hypothesis: true difference in means between group 0 and group 1 is not equal to 0
## 95 percent confidence interval:
##  -11.280194  -3.209684
## sample estimates:
## mean in group 0 mean in group 1 
##        17.14737        24.39231

報告例t(18.33) = -3.77, p = .001


対応ありt検定(第11回)の復習

set.seed(42)
n <- 15
before <- round(rnorm(n, 6.0, 0.8), 1)
after  <- round(before + rnorm(n, 0.8, 0.5), 1)
t.test(after, before, paired = TRUE)
## 
##  Paired t-test
## 
## data:  after and before
## t = 3.6211, df = 14, p-value = 0.00278
## alternative hypothesis: true mean difference is not equal to 0
## 95 percent confidence interval:
##  0.2554933 0.9978400
## sample estimates:
## mean difference 
##       0.6266667

習熟度確認テスト(第2回)

以下の課題を RStudio で実行し,スクリプトを提出してください。

ファイル名:習熟度確認2_学籍番号.R


【データ】

今回は sleep データセット(R 組み込み)を使います。

# sleep データの確認
head(sleep)
str(sleep)
## 'data.frame':    20 obs. of  3 variables:
##  $ extra: num  0.7 -1.6 -0.2 -1.2 -0.1 3.4 3.7 0.8 0 2 ...
##  $ group: Factor w/ 2 levels "1","2": 1 1 1 1 1 1 1 1 1 1 ...
##  $ ID   : Factor w/ 10 levels "1","2","3","4",..: 1 2 3 4 5 6 7 8 9 10 ...

sleep データの変数: - extra:睡眠増加量(時間),基準と比べた変化量(+ が増加,- が減少) - group:投薬グループ(1 = 薬A,2 = 薬B) - ID:被験者 ID(1〜10,各グループに1〜10の同じ人が含まれる)

重要sleep データは同じ 10 人が薬 A と薬 B の両方を服用したデータです(対応あり)。


課題1:データの確認と可視化(25点)

  1. 各グループの extra の平均・標準偏差・サンプルサイズを計算してください
  2. グループごとの extra を箱ひげ図で比較してください(fill = group を使う)
# 1. 集計
sleep |>
  group_by(group) |>
  summarise(
    n    = ___,
    mean = ___,
    sd   = ___
  )

# 2. 箱ひげ図
ggplot(sleep, aes(x = ___, y = ___, fill = ___)) +
  geom_boxplot() +
  labs(title = "___", x = "___", y = "___") +
  theme_bw()

課題2:t検定(35点)

sleep データでは同じ被験者 ID(1〜10)が両グループに存在するため, 対応のある t検定 を実施します。

  1. ワイド形式に変換してください(pivot_wider() を使う)
  2. 対応のある t検定を実行してください
  3. 結果を解釈し,帰無仮説を棄却するか判断してください
# 1. ワイド形式に変換
sleep_wide <- sleep |>
  pivot_wider(
    id_cols    = ID,
    names_from  = ___,
    values_from = ___
  )
sleep_wide

# 2. 対応ありt検定(グループ1を "1", グループ2を "2" に変換済み)
t.test(sleep_wide$`2`, sleep_wide$`1`, paired = ___)

課題3:相関分析(20点)

mtcars データを使って,車の重量(wt)と燃費(mpg)の関係を分析してください。

  1. 散布図を作成してください(回帰直線付き)
  2. cor.test() で相関係数と有意性を検定してください
  3. 結果を1〜2文でまとめてください(r値,df,p値を含む)

課題4:総合問題(20点)

以下の状況で,適切な分析方法を選び,実行・解釈してください。

状況mtcars データを使い,「エンジンの形(vs:0=V型, 1=直列)によって馬力(hp)に差があるか」を検討する。

  1. まず,vs ごとの馬力の平均・SDをまとめる
  2. 適切な検定を選んで実施する(対応あり or なし?)
  3. 箱ひげ図で可視化する
  4. 結果を報告する

参考:分析の報告フォーマット

相関分析

X と Y の間には〇〇な相関が認められた,r(df) = .〇〇,p < .〇〇。

t検定

A 群(M = 〇〇,SD = 〇〇)と B 群(M = 〇〇,SD = 〇〇)の間に有意な差が認められた,t(df) = 〇〇,p = .〇〇,d = 〇〇。

カイ二乗検定

X と Y の間に有意な関連が認められた,χ²(df, N = 〇〇) = 〇〇,p < .〇〇。


本日のまとめ

  • 相関・カイ二乗・t検定(独立・対応あり)の選択と実行を確認した
  • 結果の解釈と報告のフォーマットを押さえた

次回の予告

次回(第13回)から分散分析に入ります。

  • なぜ3群以上のときにt検定を繰り返してはいけないのか?
  • 一元配置分散分析(one-way ANOVA)の論理

教科書の分散分析の章を読んでおいてください。