医療統計でよく出てくるtable1について質問がありました。





ということで今回は医療統計で使われるtable1を作る時に便利なtableoneパッケージについて紹介します。


以下に今回使う仮のデータを作りました。set.seed(1)とかfloor()とかsampleとか訳のわからないものがいっぱい出てきますが、とりあえずRに全部コピーして1行ずつ実行するとdataという名前の表が完成します。(もしくはスクリプトウィンドウにコピペして全部選択した状態でRunを押してください)

set.seed(1)
年齢 <- floor(rnorm(100,60,10))
性別 <- sample(c("男性","女性"),100,replace = TRUE)
体重 <- floor(rnorm(100,60,7))
MMT <- sample(c(1:5), 100, prob = c(0.1,0.1,0.2,0.3,0.3), replace = TRUE)
術側 <- sample(c("右","左"),100,replace = TRUE)
治療 <- sample(c(0,1),100,replace = TRUE)
data <- data.frame(年齢,性別,体重,MMT,術側,治療)
data


tableoneの使い方

0.tableoneパッケージを使えるようにする

1.事前に理解しておくこと

2.CreateTableOne関数でtable1の下地を作る

3.print関数でExcelに貼り付けるための形式に直す

4.Excelでインポート

5.できるだけプログラムを書きたくない人向けの方法



0.tableoneパッケージを使えるようにする

まずはtableoneパッケージを使えるように準備をしてください。

なおパッケージの導入方法については以下の記事で解説しています。
Rで使うパッケージのインストールについて紹介します。 : 独学で始める統計×データサイエンス



1.事前に理解しておくこと


table1はそもそも各群のベースラインを比較します。

スクリーンショット 2019-01-29 13.41.06
そのためには各変数(評価)がどんなデータか理解している必要があります


数値かカテゴリーか?

集計を行うにはその変数が数値なのか?カテゴリー変数なのか?の理解が必要です。

数値:年齢・体重

カテゴリー:性別、MMT、術側

MMTは「1が7人、2が5人・・・」と集計を行いたいとすると、値は数値ですがカテゴリー変数として集計を行う必要があります。


数値の場合は正規分布なのか?そうでないのか?

同じ数値でも正規分布かそうでないのか?を決めておくことが必要です。

正規分布であれば平均±標準偏差ですが、正規分布でない場合は中央値(四分位範囲 or 最大値〜最小値)で表現したりします。

正規分布かどうかを確認するにはヒストグラムやQ-Qplotを作成したり、シャピロ-ウィルクの正規性の検定を使ったりします。


カテゴリー変数の検定はカイ二乗検定なのかFisherの正確確率検定なのか?

カテゴリー変数の場合カイ二乗検定かFisherの正確確率検定なのかを決めておくことが必要です。

データ数が少なく各期待数が5未満だとFisherの正確確率検定を使うなどありますが、詳細は今後説明していくかもしれません。


以上を踏まえた上でtableoneパッケージを使っていきます。


2.CreateTableOne関数でtable1の下地を作る

table1の下地を作るにはCreateTableOne関数を使います。

コード(1行で書く場合)
スクリーンショット 2019-01-29 17.43.23

コード(複数行に渡って書く場合。要素の間の , を忘れずに)
スクリーンショット 2019-01-29 17.30.54

t1を表示して結果を見ます
スクリーンショット 2019-01-29 17.49.04


結果
スクリーンショット 2019-01-29 17.31.09

コード(コピペ用)
t1 <- CreateTableOne(data = data, 
                     vars = c("年齢", "性別", "体重", "MMT", "術側"), 
                     factorVars = "MMT", 
                     strata = "治療")
t1


コードはスクリプトウィンドウを使うと数行にまたがって書くことができます。


(スクリプトウィンドウについてはRコマンダーの基本的な画面の説明を行いますをご参照ください。)


CreateTableOne関数には主に4つの要素があります。


data = ○○

○○には今回使用する表の変数名が入ります。

今回は「data」という名前の表を作ったのでdataになっていますが、別の名前を使った時はその名前になります。大文字と小文字は区別しますので注意。



vars = "○○"

○○には表に乗せたい変数名を並べます。

複数の変数がある場合はc("変数名1", "変数名2")とc関数を使います。

変数名が1つなら vars = "変数名"

変数を" "ではさみ、を使って区切ってください。


factorVars = "○○"

vars = "○○"の中で「数値なんだけどカテゴリー変数」というものがあればfactorVarsに加えます。

今回でいうとMMTの1〜5の値です。

性別や術側のように数値でないカテゴリー変数は自動的にカテゴリー変数とみなしてくれるので、ここに入れるのはあくまでも「数値なんだけどカテゴリー変数」だけです。

ちなみにそういう変数がなければfactorVars = "○○"自体を消してしまってOKです。


strata = "○○"

今回の治療のように分けたいグループがここに入ります

またグループ間ごとの検定を行うこともできます。

2グループならt検定とマンホイットニーのU検定、3グループ以上なら一元配置分散分析とクラスカル=ウォリス検定を行います。

もしstrata = "○○"自体を消すとグループ分けせずに全体の要約が表示されます。

コード
スクリーンショット 2019-01-29 17.55.31
結果
スクリーンショット 2019-01-29 17.55.44



3.print関数でExcelに貼り付けるための形式に直す

これでもある程度表になっているのですが、もう一つ作業が残っています。

まだ「正規分布かそうでないか?」「見た目をもう少し修正」といったところです。

ここではprint関数を使います。

今度はtable1という変数を使います。違う名前でも構いません。


コード
スクリーンショット 2019-01-29 20.09.46


コード(コピペ用)
table1 <- print(x = t1, 
                cramVars = c("性別", "術側"),
                exact = "MMT",
                nonnormal = "体重")

write.csv(table1,"table1.csv")        

print関数にもいくつかの要素があります。

x = ○○

xには先程のcreateTableOne関数の結果を入れます。

先ほどで言う「t1」です。違う名前にした方はその名前にしてください。

" "はいりません。


cramVars = "○○"

改めてt1の性別や術側の項目を見てください。

スクリーンショット 2019-01-29 20.15.45

基本設定では2つのカテゴリーの場合、1つの要素しか出してくれません。
もちろん全体数から引けばいいといえばいいのですが、女性の数も欲しいところです。

そんな時cramVars = c("性別", "術側")を入れると以下のようになります。

スクリーンショット 2019-01-29 20.22.43


exact = "○○"

カテゴリー変数の検定は何も指定しないとカイ二乗検定を行います。

もしFisherの正確確率検定を使いたい場合(ここではMMTとする)、exact = "MMT"とします。

ちゃんとなっているかどうかは一番右のtestを見ます。exactとなっています。

nonnormal = "○○"

同じ数字でも正規分布に従わないデータがある場合は中央値(四分位範囲)で示します。

たとえば今回のデータで体重が正規分布でなかったとします。

その場合はnonnormal="体重"とすることで平均(標準偏差)ではなく中央値(四分位範囲)に変えることができます。

ちなみに四分位範囲でなく(最小値〜最大値)で表現したい場合はminMax= TRUEを付け加えます。

スクリーンショット 2019-01-29 20.35.02


write.csv(○○, "保存したい名前.csv")

table1で表示したい表を作成したあとはcsv形式で保存します。

csv形式で保存するにはwrite.csv関数を使います。

○○はprint関数で使った変数名(ここではtable1)です。

" "の中はファイル名.csvとします。


プロジェクトを作っているとfileビューでファイルを確認できます。

スクリーンショット 2019-01-29 20.59.49

もしプロジェクトを作っていなくて保存場所がわからない場合はgetwt()とコードを書き実行してください。

getwt()     

()の中は何も入れなくて大丈夫です。保存先がわかります。


4.Excelでインポート

csvファイルを作成したので、今度はExcelで読み込みます。

読み込む時はインポートを使います。

スクリーンショット 2019-01-29 13.34.04


csvファイルを選択します。

スクリーンショット 2019-01-29 13.34.54


先程作成したファイルを選択します。
スクリーンショット 2019-01-29 13.35.23


macだと文字化けします。UFT-8を選択します。

スクリーンショット 2019-01-29 13.38.09



フィールドの区切りはカンマを選択します。

スクリーンショット 2019-01-29 13.38.35


ここは特に何もせず完了します。

スクリーンショット 2019-01-29 13.38.51


貼り付ける場所を選択します。

スクリーンショット 2019-01-29 13.39.09


無事完成!
スクリーンショット 2019-01-29 21.13.01



5.できるだけプログラムを書きたくない人向けの方法


慣れると早くなるのですが、どうしてもまだ慣れないということもあると思います。

2つの方法を紹介します。


①createTableOne関数の後、printを行わずデータを直接見ながらExcelに手打ちする

print関数を使わずにsumarry関数を使います。

スクリーンショット 2019-01-29 21.16.49
スクリーンショット 2019-01-29 21.17.02
スクリーンショット 2019-01-29 21.17.21

ここにグループ毎の結果が入っています。

<数値の場合>
平均(mean)
標準偏差(sd)
中央値(median)
最小値(min)
最大値(max)

t検定か一元配置分散分析(pNormal)
マンホイットニーのU検定かクラスカル=ウォリス検定(pNonNormal)

標準化平均差(Standardize mean differences)


<カテゴリーの場合>
カテゴリー名(level)
各変数の数(freq)
各変数の%(percent)
累積%(cum.percent)

カイ二乗検定(pApprox)
Fisherの正確確率検定(pExact)


これらを見て直接Excelに打ち込んでもいいかもしれません。


②EZRを使う

EZRの「サンプルの背景データのサマリー表の出力」は実はtableone関数を使っています。

スクリーンショット 2019-01-29 21.36.32

今回の記事を見た上でこの画面を見て、どの項目がどの関数を使っているかイメージできるでしょうか。


まとめ

今回はRやプログラミングに慣れていない方でもイメージできるよう、tableone関数についてできるだけ細かく解説しました。

学会や論文の作成のサポートになれば幸いです。


Rを使っていく上でパッケージを利用する場面は多くあります。

今回はパッケージのインストールの仕方について紹介します。

インストールはRStudioで行う場合とコードを書く方法があります。


パッケージについて

統計ソフトRで何ができるか説明してみるでも説明しましたが、私はRは「Rは統計に強いスマホみたいなもの」と説明しています。

スクリーンショット 2018-12-12 23.49.06

スマホではアプリを追加して色々な機能が追加できるように、Rではパッケージを入れることで色々な機能が追加できます。

今回はtable1の作成に強いtableoneパッケージをインストールしてみます。


パッケージのinstall()とlibrary()

RStudioの場合
スクリーンショット 2019-01-29 7.20.19


RStudioでは画面右下のpackagesに既にインストールされているライブラリの一覧があります。
(最初からいっぱい入ってる!)

あまりにも数が多いですが、右上の虫眼鏡で検索することもできます。

ただインストールされているだけでは使うことができません。チェックを入れることではじめて使えるようになります

また一覧に使いたいパッケージ名がない場合は上のinstallでパッケージ名を入れるとインストールできます。その後チェックを入れると使うことができるようになります。

ちなみにインストールは1回行えば基本2度目を行う必要はありません。

ただRStudioを起動し直したりプロジェクトを変更するたびにチェックは外れるので付け直します。


Rで直接コードを書く場合

Rでコードを書く場合は以下のようになります。
今回使うパッケージはtableoneです。

library() 

RStudioで「チェックを入れる」に該当するのがlibrary関数です。
()の中にはパッケージ名が入ります。" "で囲む必要はありません。

スクリーンショット 2019-01-29 7.45.51


最初はRStudioでチェックを入れるだけでできてしまうので直接コードを書くことは少ないのですが、慣れてくると予測変換があるのでコードを打つほうが早くなります。


install.packages()

まだパッケージがインストールされていない場合はinstall.packages関数を使います。

スクリーンショット 2019-01-29 12.20.51

" "の中にパッケージ名を入れます。dependencies = TRUEはおまじないみたいなものと思っても大丈夫です。

(このパッケージの依存関係にあるパッケージをインストールします)

インストールは1回行えば基本2度目を行う必要はありません。あとは起動後やプロジェクトを変えるたびにlibraryで呼び出すだけです。


パッケージの使い方

それぞれのパッケージにはそれぞれの関数があります。

ここではtable1を作成するCreateTableOne関数を呼び出すとします。

スクリーンショット 2019-01-29 13.06.57

パッケージの関数を使う時は直接関数名を打ち込んで問題ないのですが、あえて「このパッケージを使います!」とtableone::CreateTableOne(〜〜〜〜〜)と関数名を宣言することもできます。

普通に個人で使う場合は上の前者の方法で十分だと思います。


まとめ

今回はパッケージの呼び出し方について解説しました。

具体的なパッケージや関数は必要に応じて紹介していきます。



前回、医療統計でよく使われるdata.frameについて説明しました。

医療統計をRで使うために必要な「データフレーム」にの考え方ついて : 独学で始める統計×データサイエンス



記事でも紹介しましたが、data.frameはベクトルの集合体とも言えます。

スクリーンショット 2018-08-29 19.54.22

各列には「氏名(文字)、年齢(数値)、性別(男性/女性の2カテゴリー)」など色々な種類のデータが入っています。Rで統計を行うときにはこのデータの型を理解する必要があります。

今回はデータの型について説明します。




医療統計で使われる代表的な型

スクリーンショット 2019-01-25 3.04.20


numeric(実数)

例)
  • 身長
  • 体重
  • 歩行速度
  • 年齢
numericは数字のことです。numericの特徴としては四則演算(+,-,×,÷)ができます。
また1と2の間隔と2と3の間隔は同じです。

またnumericには小数点以下がある実数(double)と整数(integer)でも使えます。


character(文字)

例)
  • 氏名
  • 文字
  • "1"
文字にあたるものはcharacterとなります。数字でも"1"のように""で挟むとcharacterとして認識されます。
スクリーンショット 2019-01-25 3.21.40
上記ではaは文字で1は数字なので「計算できません」とエラーが出ます。

スクリーンショット 2019-01-25 3.24.09
上記ではaに1という文字を入れたのでやはり計算できません。



factor / order

例)
  • 男性/女性
  • 右/左
  • 年齢(10代,20代〜)
  • 1:不満足/2:やや満足/3:満足
  • 数値で分類している場合(0:非自立,1:自立)
factor /order型はグループ分けしている時に使います。「1:不満足」を2倍をしても「2:やや満足」にならず四則演算ができないのも特徴です。

factorは性別など順序がないものに使われ、orderは順番があるもの(10代〜、5段階評価など)に使われます。


logical

スクリーンショット 2019-01-25 14.56.28

logicalの代表的なものにTRUE とFALSEがあります。
年齢 < 60 とすることで、60未満をTRUE、それ以外をFALSEとなります。
TRUEは1、FALSEは0とみなすことができ、sum関数でTRUEの合計を、mean関数で割合(ここでは2/5=0.4)を出すことができます。

TRUE/FALSE以外にもExcelのセルが空欄の時に表示されるNULLがあります。



0とNULLの違いはこのツイートが最強です。



class()とstr()

ではどうやって型を確認すればいいのでしょうか?これはclass関数やstr関数を使います。


class()

スクリーンショット 2019-01-25 3.31.53

上記のようにclass(変数名)とします。

aとbは同じ1でも型が違うのがわかります。



str()

上記でも紹介しましたが、data.frameはベクトルの集合体とも言えます。

スクリーンショット 2018-08-29 19.54.22

各列には「氏名(文字)、年齢(数値)、性別(男性/女性の2カテゴリー)」など色々な種類のデータが入っています。Rで統計を行うときにはこのデータの型を理解する必要があります。

str関数は各列(ベクトル)の型をまとめて調べることができます。

スクリーンショット 2019-01-25 14.45.20

右上の表をdataという変数名に入れています。

赤枠で囲ったところに型があります。

性別を見るとfactorで"女性"と"男性"の2カテゴリーであることがわかります。



型を変更するas.〜関数

型を変えるにはas.〜関数を使います。

as.character()

先程のstr(data)の氏名を見ると型はfactorになっています。これをcharacterに変えてみます。

コード
スクリーンショット 2019-01-25 19.28.57

結果
スクリーンショット 2019-01-25 19.29.10

data$氏名がわかりにくかったら医療統計をRで使うために必要な「データフレーム」にの考え方ついてを参照してください。

単にas.character(data$氏名)とするだけでは不十分です。

data$氏名 <- as.character(data$氏名)とすることでas.character(data$氏名)をdata$氏名に入れてね!という意味になります。


もしdata$氏名 <− を入れなかったら・・・
スクリーンショット 2019-01-25 19.48.13

結果
スクリーンショット 2019-01-25 19.52.56
data$氏名 <− を入れないと最後の結果が更新されていません。

つまりas.character(data$氏名)だけだとdata$氏名をcharacterにした結果を出してまでの意味しかないので注意してください。



as.numeric()

数値に変える時はas.numericを使います。

コード
スクリーンショット 2019-01-25 19.42.28

結果
スクリーンショット 2019-01-25 19.41.32


もし整数にしたい時はas.integerを使います。小数点切り捨てです。
スクリーンショット 2019-01-25 20.47.18

スクリーンショット 2019-01-25 20.47.36



as.factor / factor / ordered

factor型に変更するにはas.factor、factor、orderedなどを使います。


スクリーンショット 2019-01-25 23.06.24

dataに歩行という列を追加しています。
ここでは0:非自立、1:監視、2:自立としています。


スクリーンショット 2019-01-25 23.11.11

スクリーンショット 2019-01-25 23.10.53

最初はnumericと数値でしたが、as.factor関数を使うことでfactorに変わっています。
ここではclassではなくstr(data$歩行)で型を確認しています。

strを使うと型がfactorということだけでなく、levelsを見ると0,1,2の3つのカテゴリーがあることもわかります。

ただ0,1,2のままではグラフなどが困ります。その時はfactor関数(as.factorではないです)のlabelsを使うことでデータは0,1,2のまま表記を変えることができます。

スクリーンショット 2019-01-25 23.55.20

スクリーンショット 2019-01-25 23.55.11


スクリーンショット 2019-01-26 0.03.06


ちなみにfactorの順番はアルファベット順になってます。
0,1,2などは問題ないのですが、大,中,小などでは小→大→中など望ましくない順番になることがあります。性別は女性→男性となっています。

factorの並び順を変更するにはfactor関数のlevelsを使います。

スクリーンショット 2019-01-26 0.08.33

スクリーンショット 2019-01-26 0.09.27

スクリーンショット 2019-01-26 0.10.33



また並び順に意味がある場合はordered = TRUEを付け加えます。


スクリーンショット 2019-01-26 0.49.54

スクリーンショット 2019-01-26 0.50.41



EZRだと?

スクリーンショット 2019-01-26 1.17.11

EZRではアクティブデータセット→変数の操作にあたります。
赤枠の「データセット内の変数を一覧する」はstr()を使っているだけです。


まとめ

今回は型について説明を行いました。

エクセルから読み込んだ時はまずstrで型を確認してみてはいかがでしょうか。



↑このページのトップヘ