統計学Ⅰ(B) 北星学園大学 小野原 彩香
ここまで電卓・グラフ用紙でやってきた人、お疲れさま。
第2・3回の代表値・ばらつきを、今日は自分のコードで。 やるのは空欄 ____ を埋めるだけ。
____
エラーメッセージ=「ここが違うよ」というお知らせ
KeyError: '列名'
SyntaxError
落ち着いて読めば、原因はたいてい書いてある。
df = pd.read_csv(URL) # 表を読み込む df.shape # (種数, 列数) df.head() # 先頭5行
行 = 1つの種 列 = 体重・妊娠期間などの項目
df["体重g"].mean() # 平均 → 5880.9 df["体重g"].median() # 中央値 → 3006.0 df["一腹産子数"].mode() # 最頻値 → 1.01
電卓で出した値と同じ。違いは速さと正確さだけ。
df["妊娠期間日"].std() # SD → 37.8 df["体重g"].describe() # 一気に要約 df.groupby("科")["体重g"].mean() # 科別平均 df.isna().sum() # 欠損の確認 plt.hist(df["体重g"].dropna()) # グラフ1行
手計算なら数十分 → 一瞬
df["列名"]
.mean() .median() .mode()
.std() .var()
.describe()
df.groupby("列")["列"].mean()
df.isna().sum()