
Kaggleで勝つデータ分析の技術
門脇 大輔, 阪田 隆司, 保坂 桂佑, and 平松 雄司
この本について
データ分析を仕事でやっていると、「とりあえず前処理してモデルに入れて…で、本当にこれでいいんだっけ?」みたいなもやつきがずっと残りませんか。自分もカテゴリ変数の扱いや欠損の処理で何度も手が止まりました。丁寧にやるほど泥沼になるのに、なぜかスコアが伸びない、あの感じです。 この本が助かったのは、細かい“お作法”で迷子になっていた部分を、実務とコンペの両方の視点で整理してくれたところです。例えば、ダミー変数を水準数そのまま作っても問題ない理由とか、GBDTがどこまで面倒を見てくれるのか、そしてどこからは自分で特徴量として明示した方がいいのか。この線引きが具体例つきで書かれていて、「あ、ここは気にしなくていいのか」と肩の力が抜けました。 また、別テーブルの結合やユーザごとの集計など、結局どの現場でも必ずやる作業について、ただの手順ではなく“どんな情報を補えるのか”という考え方から説明されているのがありがたいです。欠損が起きている理由そのものを特徴量にする、という発想も自分にはなかったものでした。 モデルのチューニングより前に、「そもそも入力として何を渡すか」で迷いがちな人には特に刺さると思います。仕組みを理解した上で手を動かせるようになるので、余計な遠回りが減りました。
読書インサイト
ハイライト密度
多くの読者は第3章に最もインサイトを感じており、全ハイライトの29%が集中しています。
読書の順序
この本の前に読まれた本
プロダクトマネジメントのすべて 事業戦略・IT開発・UXデザイン・マーケティングからチーム・組織運営まで
及川 卓也, 小城 久美子, and 曽根原 春樹
現役LPO会社社長から学ぶ コンバージョンを獲る ランディングページ
相原 祐樹
Holes (English Edition)
Louis Sachar, Vladimir Radunsky, and Bagram Ibatoulline
現場ですぐ使える時系列データ分析~データサイエンティストのための基礎知識~
横内大介 and 青木義充
コロナ後の世界 (文春新書)
ジャレド・ダイアモンド, ポール・クルーグマン, リンダ・グラットン, マックス・テグマーク, スティーブン・ピンカー, スコット・ギャロウェイ, and 大野 和基
この本に似ている本
すべて見る arrow_right_alt
実践Data Scienceシリーズ PythonではじめるKaggleスタートブック (KS情報科学専門書)
石原祥太郎、村田秀樹

kaggleで上位に入るための探索的データ解析入門
田邉 正幸

Python機械学習プログラミング 達人データサイエンティストによる理論と実践 impress top gearシリーズ
Sebastian Raschka, 株式会社クイープ, and 福島 真太朗

機械脳の時代――データサイエンスは戦略・組織・仕事をどう変えるのか?
加藤 エルテス 聡志
![改訂2版 データサイエンティスト養成読本 [プロになるためのデータ分析力が身につく!]](https://m.media-amazon.com/images/I/91GvtoH8VgL._SY500.jpg)
改訂2版 データサイエンティスト養成読本 [プロになるためのデータ分析力が身につく!]
佐藤洋行、原田博植、里洋平、和田計也、早川敦士、倉橋一成、下田倫大、大成浩子、奥野晃裕、中川帝人、長岡裕己、中原誠
読んだ内容を、もう忘れない。
BookNotion Zなら、Kindleのハイライトを自動で保存・整理。Notionにエクスポートして、いつでも振り返れます。
クレジットカード不要