Kaggle Note
はじめに CatBoostではtext_featuresに生の文字列を渡すだけで、トークン化とベクトル化を内部で勝手にやってくれます。この記事
はじめに カテゴリ変数の定番エンコードに target encoding(平均エンコード) があります。カテゴリを「そのカテゴリでの目的変数の平均」で置き換え
はじめに 予測値だけでなく「その予測にどれくらい自信がないか」を出したいことがあります。分位点回帰では予測区間(ばらつきの幅)を出しましたが、
はじめに CatBoostは勾配ブースティング決定木の実装のひとつで、LightGBMやXGBoostと並ぶ選択肢です。特徴は大きく2つありま
はじめに faissでベクトルをそのまま持つと、float32なので1次元あたり4バイトです。100次元なら1件400バイト、118万件で約4
はじめに 埋め込みベクトルで「似ているものを探す」とき、素直にやるなら全ベクトルとの距離を総当たりで計算します。正確ですが、ベクトルが数百万件
はじめに 決定木は、条件分岐でデータをたどり、各サンプルを必ず1つの葉に振り分けます。1つの葉は「同じ条件をたどってきたサンプルの集まり」——
はじめに LightGBMはlgb.trainのinit_model引数に既存モデルを渡すと、そのモデルを起点に学習を続けられます。すでにある
はじめに 保険金の請求額、店舗ごとの需要、広告のコンバージョン金額——こうしたデータは「多くがゼロ、ときどき大きな正の値」という形をしています
はじめに カテゴリ変数を勾配ブースティングに入れるとき、one-hotエンコーディングで0/1の列に展開するのが定番です。 一方でLightGB