pandasで欠損値を処理
欠損値は不完全なデータ源や入力エラーから発生します。
pandasで欠損値を処理とは?
欠損値は不完全なデータ源や入力エラーから発生します。
欠けた値を検出して補完します。
どのような場面で使う?
- 表形式データを読み込み、整形する。
- CSV・API・データベースのデータを分析する。
- レポートや統計値を作成する。
サンプルコード
main.py
import pandas as pd
import numpy as np
students = pd.DataFrame({"name": ["Ada", "Lin", "Sam"], "score": [95, np.nan, 85]})
students["score"] = students["score"].fillna(students["score"].median())
print(students)
期待される出力
name score
0 Ada 95.0
1 Lin 90.0
2 Sam 85.0
仕組み
中央値でNaNを補えますが、削除か補完かはデータの意味に基づいて選びます。
値を変更し、PythonをインストールせずにCodeUtilityオンラインPythonコンパイラで実行できます。
練習問題
入力値と境界ケースを変更し、より大きなデータでも動作を確認してください。
- 行、列、欠損値を追加する。
- フィルタ、ソート、groupbyを組み合わせる。
- 実ファイルを読み込みdtypeを確認する。