
NVIDIAがNemotronエージェント学習データを公開:10兆超トークンとプロンプトアトラス
NVIDIAはHugging Face上でNemotronのオープンデータコレクションを公開した。これには10兆以上の事前学習トークンと数百万件の事後学習サンプル、各サンプルをドメインやツール使用ごとにマッピングするインタラクティブな「Prompt Atlas」、そして現在10カ国・24億人をカバーする「Nemotron-Personas」が含まれる。ここで重要なのは検証可能性だ。オープンウェイトだけでなくオープンデータセットが提供されることで、開発者はエージェントがなぜツールを呼び出したのか、あるいはエラーからどのように回復したのかを追跡できるようになる。これは同社のGPUエコシステムを拡大するという戦略をさらに深めるものでもあり、すでに145件近くのICML論文がNemotronのモデルとデータを引用している。
出典: huggingface.co ↗