
新型コロナが猛威を振るい始めた3月から10ヶ月が過ぎた。一日一回、自治体が公開する感染者データを取り込み、分析し、行動する日常。そんな日常も、ほんのちょっとのことで、変わってしまう。
感染者が急増してきた11月24日ころから、データを利用している自治体が公開データのフォーマットを変更した。これまでは、一人分の感染者属性データを復習行で記載していたのに、今度は、一人一行の表のようなデータ形式。しかもPDF。CSVで表現できるデータ形式なのに。しかも、このPDF、Google-AIまで駆使し、どう頑張ってもテキスト変換できない。変更理由、事前通知、なにもなし。
そのため、これまでの習熟した読込みの手順、編集スクリプトが使えない。データを手打ちしても、感染者数が多く、入力を間違ってばかりいる。困ったことになった。
困った、困った。といっっていても仕方がない。新たなデータ形式、これまで使ってきたスクリプトが期待している入力データの形式の両方を、ジッとにらみ続けた。これまでは、複数行からなる一人の属性データを読んで、複数属性からなる感染者一人の一行データを作成してきた。今度の形式では、属性データを列毎に複数人分読み、属性データ列を複数人分一気に作成した方がうまくいく事がわかった。
ただ、新フォーマットは、これまでとは列順が異なるし、性別などの属性値も、そのまま入力するのは難しそうだ。昔、sedとawkを組み合わせて、似たようなことをやったことを思い出した。使えそうだ。これまで使ってきたRスクリプトの前処理に、今回さらに前処理を付け加えたことになる。
こんな感じの前処理。
#!/bin/sh
cat today|sed -e ‘s/m/男性/g’ -e ‘s/f/女性/g’ -e ‘s/市外//g’|awk -F “,” -v today=”$(date +%F)” ‘{printf “\”” today “\”,\”” $3 “\”,\”” $1 “\”,\”” $2 “\”\n”}’
データがどのように使われているか想像がつかない人がデータを公開している。単に、公開媒体を紙からPDFにかえただけ。それでは、DXとかデジタル自治体とかいわないとおもう。再利用可能な形態でデータを公開できることが、デジタル対応した自治体。論文が引用されることに価値があるように、デジタルデータはその複写の容易性、正確性を活かし、再利用されることに価値がある。
コメントを残す