セットアップ
JupyterLab を使用している場合は、このガイドの残りの手順に進む前に、ノートブックを作成してください。
データセットのダウンロード
chDB と JupySQL の設定
dbapi モジュールをインポートします。
taxi.chdb ディレクトリに保存されます。
sqlマジックをロードし、chDB への接続を確立します:
TSV ファイル内のデータをクエリする
trips_ プレフィックスが付いた複数のファイルをダウンロードしました。
DESCRIBE 句を使用してスキーマを確認しましょう。
SELECT クエリを実行し、データの内容を確認することもできます。
trip_distance、fare_amount、tip_amountは、数値型ではなくStringとして推論されています。
データをテーブルにインポートする際に、これらを修正します。
chDB への TSV ファイルのインポート
trips テーブルを作成します。
REPLACE 句を使用して金額関連のカラムを Float64 にキャストし、transform 関数を使用して数値の pickup_borocode カラムを人間が読める borough 名に変換します。
zones というテーブルを作成します。
chDB をクエリする
クエリの保存
%%sql マジックと同じ行で --save パラメータを使用すると、クエリを保存できます。
--no-execute パラメータを指定すると、クエリの実行をスキップできます。
パラメータを使用したクエリ
{{variable}} 構文を使用できます。
次のクエリは、乗車記録数が 10,000 回を超える地域のうち、平均チップ額が最も高い地域を検索します。