415.tech
シリコンバレー発、AIとテックの最前線
Apache Spark 4.2、ネイティブベクトル検索やAuto CDCを搭載

Apache Spark 4.2、ネイティブベクトル検索やAuto CDCを搭載

Apache Spark 4.2は、AIデータスタックをエンジン自体に統合した。NEAREST BYによるtop-Kベクトル検索や類似度関数、リテンションやユニークカウントといった非加法的な指標の定義をBIやエージェント間で統一するメトリックビュー、そしてSCD Type 1テーブルの手書きマージロジックを置き換えるAuto CDCが追加された。Arrow最適化されたPython UDFはデフォルトでより高速なカラムナーパスで実行されるようになり、既存のUDFはコードを書き換えることなく高速化される。開発者は、個別のベクトルストアやマージパイプラインを後付けする代わりに、Spark SQL内で直接検索や変更データのレプリケーションを構築できる。

出典: databricks.com

Xでポストメール

エージェントまたはアプリケーションは自身のランタイムからSparkを呼び出すことができ、その間、Sparkはanalysis、optimization、execution、governanceをサーバー上に保持する。

Apache Spark 4.2 リリースノート

なぜ重要か

  • → vector search、metrics、CDCを別々のツールではなく、単一エンジンに統合する。
  • → AI applicationsとBI dashboardsが、一貫した真実の定義を使用できるようにする。
  • → Arrow-optimized Python UDFsが、コード変更なしでデフォルトで高速に実行される。
AI stackの統合