3 Lessons3 Reference Docs
Jev (System 1 Decision Model) による判断・評価タスクの実践
従来の文章生成型LLM(LLM-as-a-judge)が抱える「高コスト・高レイテンシ・出力揺れ」を解消し、テキスト生成を行わず判断・スコアリング・分類のみを超高速かつ低コストに実行する決定モデル「Jev」の特性を理解し、Pythonから自作ルーブリックを用いた評価タスクを実践的に構築・運用できるようになる。
📚 生成されたレッスン (Interactive Lessons)
📑 参考資料・リファレンス (Reference Documents)
🎯 Mission (学習の目的・到達目標)
Mission: Jev (System 1 Decision Model) による判断・評価タスクの実践
Why
従来の文章生成型LLM(LLM-as-a-judge)が抱える「高コスト・高レイテンシ・出力揺れ」を解消し、テキスト生成を行わず判断・スコアリング・分類のみを超高速かつ低コストに実行する決定モデル「Jev」の特性を理解し、Pythonから自作ルーブリックを用いた評価タスクを実践的に構築・運用できるようになる。
Success looks like
- Jevのコアアーキテクチャ(System 1意思決定モデル、3つのプリミティブ:Noul, Choice, Score)を理解・説明できる
- Python(
typesafe-sdk)を用いてJevを呼び出し、判定結果とキャリブレーション確率(信頼度スコア)を取得・ハンドリングできる - 自作の評価基準(ルーブリック)を定義し、実データに対するカスタム判定タスク(品質検査・ルーティング・分類等)をコードで実装・実行できる
Constraints
- Python(3.10+)を用いたコードベースの実践
- 概念理解だけでなく、実践的なルーブリック設計とコード実行にフォーカスする
Out of scope
- 自由記述の長文生成・要約タスク(Jevの対象外)
- 大規模なSystem 2推論フレームワーク全体のフルスクラッチ構築
📖 Resources (参照元・一次情報)
Jev Resources
Knowledge
- TypeSafe AI: Jev Documentation & SDK Guide Jevの公式ドキュメントおよびSDKリファレンス。System 1決定モデルの仕様、API仕様、主要な3つのプリミティブ(Noul, Choice, Score)の詳細。
- Pydantic AI Documentation: TypeSafeModel Integration Pydantic AIとのネイティブ統合ドキュメント。エージェントパイプラインへの組み込みやTyped Outputの連携パターン。
- Langfuse: Decision-Model Evaluator Guide JevをLLM評価フレームワークにおける決定モデル型エバリュエーターとして導入・運用するベストプラクティス。
- DeepEval: JevEval Metrics Guide Jevを用いたクローズドルーブリック高速評価指標の実装例とカスケードアーキテクチャ。
Wisdom (Communities)
- TypeSafe AI Community Discord / Forum Jevの開発者コミュニティ。ルーブリック設計のコツ、閾値チューニング、エッジケースの議論。
- r/LocalLLaMA & r/MachineLearning LLM-as-a-judgeのコスト最適化や決定モデル(System 1 / 2 ハイブリッド)の実運用に関する議論。