LAB — 実験と検証
実験とリサーチ
LLM、マルチエージェント、検索拡張生成(RAG)、コンピュータビジョン。すべての実験が製品になるわけではありませんが、そこで得た知見は必ずクライアントワークに還元しています。
10全体
8稼働中
2研究中
すべての実験
LLM
ローカルLLMコードレビュアー
ローカルで動かすLLMによる自動コードレビュー。プライバシー優先で、データは一切マシンの外に出ない。
モデル
Qwen 2.5 72BLlama 3.3 70BCodeLlama
結果
バグ検出率85%平均応答2.9秒API費用ゼロ
OllamaPythonASTFastAPITree-sitter
LLM詳しく見る
エージェント
音声からSQLを生成するエージェント
自然言語で話しかけるだけでSQLの結果が返る。function callingのエージェントが意図をクエリへ翻訳する。
モデル
GPT-4oWhisper Large-v3
結果
クエリ精度94%発話から結果まで1.2秒スキーマを踏まえたバリデーション
WhisperFastAPISQLiteReactLangChain
エージェント詳しく見る
RAG
RAG評価ハーネス
チャンク分割の戦略、埋め込みモデル、検索手法を12の指標で自動比較するベンチマークスイート。
モデル
Claude SonnetGPT-4oall-MiniLM-L6
結果
12種類の評価指標6種類のチャンク分割戦略4種類の埋め込みモデルを比較
PythonDeepEvalRAGASpgvectorStreamlit
RAG詳しく見る
エージェント
マルチエージェント討論システム
3体のAIエージェントが同じテーマで対立する立場から議論し、審判役のエージェントが最も強い論点を統合する。
モデル
Claude SonnetGPT-4oGemini 2.5 Pro
結果
3ラウンドの討論リアルタイムストリーミングモデル横断の比較
LangGraphNext.jsRedisWebSockets
エージェント詳しく見る
画像認識
文書ビジョンパーサー
ビジョンモデルでレシート、請求書、各種フォームから構造化データを抽出する。OCRのテンプレートは不要。
モデル
GPT-4o VisionClaude Vision
結果
フィールド抽出精度96%処理時間1.8秒テンプレート設定ゼロ
GPT-4o VisionFastAPIPydanticReactCanvas API
画像認識詳しく見る
エージェント
エージェントの記憶アーキテクチャ
AIエージェントのための永続的な記憶層。エピソード記憶、意味記憶、手続き記憶を忘却曲線とともに扱う。
モデル
Claude Sonnetall-MiniLM-L6
結果
3種類の記憶エビングハウスの忘却曲線グラフベースの検索
PythonpgvectorNetworkXLangGraphNeo4j
エージェント詳しく見る
LLM
リアルタイム感情分析ストリーム
流れ続けるテキストの感情をリアルタイムに分析する。SNSの投稿、チャット、サポートチケットを100ms未満で処理する。
モデル
DistilBERT (fine-tuned)RoBERTa
結果
精度94%レイテンシ100ms未満スループット毎秒1万件
DistilBERTKafkaFastAPINext.jsClickHouse
LLM詳しく見る
RAG
PDFからナレッジグラフへ
PDFをアップロードすると、エンティティの関係と出典を備えたインタラクティブなナレッジグラフに変わる。
モデル
Claude SonnetGPT-4o
結果
エンティティ抽出のF1: 0.89インタラクティブなグラフ可視化出典へのリンク
Neo4jLlamaParseD3.jsNext.jsFastAPI
RAG詳しく見る
自動化
ブラウザ自動操作エージェント
目的を言葉で伝えるだけで、サイトを辿り、フォームを埋め、データを抽出し、タスクを自律的に完了する。
モデル
GPT-4o VisionClaude Sonnet
結果
タスク完了率78%複数ステップの画面遷移に対応画面を見てDOMを理解
PlaywrightGPT-4o VisionPythonLangGraphRedis
自動化詳しく見る
LLM
プロンプト最適化ラボ
プロンプトエンジニアリングの自動化。遺伝的アルゴリズムとA/Bテストで、評価スイートに合わせてプロンプトを進化させる。
モデル
Claude SonnetGPT-4oGemini 2.5 Pro
結果
平均15%の精度向上遺伝的アルゴリズムによる進化統計的有意性の検定
PythonDSPyDeepEvalStreamlitRedis
LLM詳しく見る