Pythonでデータ分析を始めたいけれど、次のように迷っていませんか。
- Pandasの記事が多く、何から読めばよいかわからない
- DataFrameを確認した後、前処理・抽出・集計へどう進むのかわからない
- 時系列データやグラフを、どの順番で学べばよいかわからない
このページでは、Python Data LabのPandas・Matplotlib記事を、実際のデータ分析の流れに沿って整理しました。すべての記事を順番に読む必要はありません。「最初に読む」「次に読む」「必要になったら読む」の3段階から、今の目的に合う記事を選んでください。
このページでわかること
- Pandas初心者が最初に読むべき記事
- データの確認・抽出・前処理・集計・時系列分析・可視化の学習順
- 自分の悩みに合う記事の選び方
- 記事を読み終えた後、次に進む目安
迷ったら、まずは次の5記事から始めましょう。
Pandas学習ロードマップの全体像
このロードマップでは、次の7つのSTEPで学習を進めます。
- Google Colabでデータを読み込む
- DataFrameの中身を確認する
- 必要な行・列を抽出する
- 前処理でデータを整える
- 集計・変形・結合を行う
- 日付・時系列データの変化を分析する
- Matplotlibで可視化する
最初に読むは基本ルート、次に読むは理解を広げる記事、必要なときは目的別の発展記事です。
STEP1:Google Colabでデータを読み込む
最初にPythonを動かし、分析するデータをDataFrameとして読み込みます。初心者には、インストール不要で使えるGoogle Colabがおすすめです。
- 最初に読むGoogle Colabの始め方
ノートブックを開き、Pythonコードを実行する準備をします。 - 最初に読むGoogle ColabでCSVを読み込む方法
アップロードやGoogle DriveからCSVを読み込みます。 - 必要なときpandas read_excel()の使い方
Excelのシートや列を指定して読み込みます。
STEP2:DataFrameの中身を確認する
前処理を始める前に、行・列、データ型、欠損値、値の分布を確認します。分析結果の間違いを防ぐために、飛ばさない方がよいSTEPです。
- 最初に読むPandas DataFrame入門
DataFrameの構造、作り方、Seriesとの違いを理解します。 - 最初に読むpandas head()・tail()の使い方
先頭・末尾の行を表示して、列名や値を確認します。 - 最初に読むpandas describe()の使い方
データ型、欠損状況、基本統計量と結果の読み方を確認します。 - 次に読むpandas unique()・nunique()の使い方
値の種類と種類数を確認します。 - 必要なときpandas select_dtypes()の使い方
数値列や文字列など、データ型で列を選びます。
STEP3:必要な行・列を抽出する
分析に必要な列や、条件に合う行だけを取り出します。最初はlocとilocの違いを理解し、その後に条件抽出へ進むと迷いにくくなります。
3-1. 行名・列名・位置で抽出する
- 最初に読むPandas locとilocの違い
- 次に読むpandas locの使い方
- 次に読むpandas ilocの使い方
3-2. 条件に合う行を抽出する
- 最初に読むpandas条件抽出の基本
- 次に読むpandas isin()の使い方:複数候補のいずれかに一致する行を抽出
- 次に読むpandas between()の使い方:数値・日付の範囲で抽出
- 必要なときpandas str.contains()の使い方:文字列を含む行を抽出
STEP4:前処理でデータを整える
実際のデータには、表記ゆれ、余分な空白、型の不一致、欠損値、重複などがあります。すべて覚えるのではなく、自分のデータにある問題から選んでください。
4-1. 列名・文字列・値を整える
- 最初に読むpandas rename()の使い方
- 次に読むpandas str.strip()の使い方
- 次に読むpandas replace()の使い方
- 必要なときpandas map()の使い方
4-2. 数値型・日付型へ変換する
- 最初に読むpandas astype()の使い方
- 次に読むpandas to_numeric()の使い方
- 次に読むpandas to_datetime()の使い方
- 必要なときpandas dtの使い方
4-3. 欠損値・重複を処理する
- 最初に読むpandas isnull()で欠損値を確認する
- 次に読むpandas fillna()の使い方
- 次に読むpandas duplicated()の使い方
- 必要なときdropna()・drop_duplicates()の使い方
4-4. 列・値・インデックスを加工する
- 最初に読むpandasで新しい列を追加する方法
- 次に読むpandasでデータを並び替える方法
- 次に読むpandas reset_index()の使い方
- 必要なときpandas set_index()の使い方
- 必要なときpandas cut()の使い方
- 必要なときpandas where()・mask()の使い方
- 必要なときpandas apply()の使い方
STEP5:集計・変形・結合を行う
整えたデータから件数・合計・平均などを求め、分析しやすい表へ変形します。複数のDataFrameを組み合わせる場合は結合も学びます。
5-1. 件数・グループ・クロス集計
- 最初に読むpandas value_counts()の使い方
- 最初に読むPandas groupby×aggの使い方
- 次に読むpandas crosstab()の使い方
- 必要なときpandas corr()の使い方
5-2. 表の形を変える
5-3. 複数のDataFrameを結合する
- 最初に読むpandas merge()の使い方
- 次に読むpandas concat()の使い方
STEP6:日付・時系列データの変化を分析する
日別・月別の売上など、時間順に並ぶデータを分析します。ここでは、日付の準備、期間集計、増減量、増減率、移動平均を順番に学びます。
おすすめの学習順
to_datetime()で日付型へ変換するsort_values()で古い日付から並べるresample()で月別・週別に集計するdiff()で増減量を求めるpct_change()で増減率を求めるrolling()で移動平均を求める
- 最初に読むpandas to_datetime()の使い方
- 最初に読むpandas resample()の使い方
- 次に読むpandas diff()の使い方:何円・何個増減したかを確認
- 次に読むpandas pct_change()の使い方:何%増減したかを確認
- 次に読むpandas rolling()の使い方:移動平均で短期変動を滑らかにする
- 必要なときpandas dtの使い方:年・月・曜日を取り出す
| 知りたいこと | 選ぶ機能 | 結果 |
|---|---|---|
| 月別・週別にまとめたい | resample() | 期間ごとの集計値 |
| 前の行から何円増えたか知りたい | diff() | 増減量 |
| 前の行から何%増えたか知りたい | pct_change() | 増減率 |
| 変動を滑らかに見たい | rolling() | 移動平均など |
STEP7:Matplotlibで可視化する
Pandasで確認・前処理・集計した結果をグラフにすると、時間的な変化、カテゴリ差、分布、相関を理解しやすくなります。目的に合うグラフから選びましょう。
7-1. まず読む基本記事
- 最初に読むMatplotlibのFigureとAxesの基本
- 最初に読むMatplotlib折れ線グラフの描き方
- 次に読むMatplotlib棒グラフの描き方
- 次に読むMatplotlib散布図の描き方
- 次に読むMatplotlibヒストグラム・箱ひげ図の使い方
7-2. グラフを見やすく整える
- 必要なとき軸・注釈・凡例の設定方法
- 必要なとき配色・カラーマップ・colorbarの使い方
- 必要なとき複数グラフを並べる方法
目的別:どこから読めばよいか
すべての記事を読む必要はありません。現在の悩みに最も近い行から始めてください。
| 今の悩み | 読むSTEP | 最初に読む記事 |
|---|---|---|
| Colabでデータを読み込めない | STEP1 | Google Colabの始め方、CSV読み込み |
| DataFrameの中身を確認したい | STEP2 | DataFrame、head、describe |
| 必要な行や列を取り出したい | STEP3 | locとiloc、条件抽出 |
| 文字列・型・欠損値を整えたい | STEP4 | rename、astype、isnull、fillna |
| 件数やグループ別に集計したい | STEP5 | value_counts、groupby、pivot |
| 前日比・前月比・移動平均を求めたい | STEP6 | resample、diff、pct_change、rolling |
| 結果をグラフで確認したい | STEP7 | FigureとAxes、折れ線グラフ |
初心者向けの3つの学習ルート
| 目的 | おすすめの順番 |
|---|---|
| まず基本操作を覚える | STEP1 → STEP2 → STEP3 → STEP4の基本 → STEP5の基本 |
| CSVを前処理して集計する | CSV読み込み → head・describe → 型・欠損値処理 → groupby・pivot |
| 日別売上を時系列分析する | CSV読み込み → to_datetime → sort → resample → diff・pct_change → rolling → 折れ線グラフ |
まとめ:Pandasは分析の流れに沿って学ぶ
Pandasのメソッドを最初からすべて覚える必要はありません。まずデータを読み込み、DataFrameの中身を確認します。その後、必要なデータを抽出し、型・欠損値・重複・並び順を整え、集計・時系列分析・可視化へ進みます。
迷ったときは、このロードマップに戻り、今の作業が「確認・抽出・前処理・集計・時系列分析・可視化」のどこにあるかを確認してください。Python Data Labでは、各記事をGoogle Colabで実行しながら学べるように整理しています。