そうだ、TomaAI Client v2を作ろう

この世代では、画像認識、画像生成などを使ったものである。

Steps

  1. 計画を50文字で作らせる。
  2. メインモデルの実行
  3. RAGの呼び出し
  4. ツールチェーンの呼び出し(pipelineなど)
  5. ハルシネーション対策の開始
  6. RAGの呼び出し
  7. 反論の生成
  8. メインモデルにお返し(10回まで行う)
  9. 全ステップ結論の生成

Models

メインモデル: LLaVA(Llama + 画像認識)
画像生成: Stable Diffusion 3.5
ControlNet: T2I-Adapter

Frameworks

基本推論周辺: LangGraph
RAG: Qdrant

補足

RAGの情報元: LlamaIndex
エージェント検索時のモデルへの情報提供方法: Seleniumでサイトのレンダリング + Turndown

これを無事リリースできるかわからないけど、なんで僕が作る物って世代変わると色々変わるんだ?
TomaAI Classic 2.0もそうだし


まあ少なくともTomaAI Client系統は既存モデルの組み合わせという点では同じだね

訂正

  1. LLaVAはツールカーリング非対応でした。
    ->解決策: LLaVA-Plusを使用。
  2. 開発にColabを使用しようと思っていたが、Stable Diffusion 3.5は無料枠には重すぎる
    ->解決策: SDXLを使用、同時にControlNetも本家に変更

訂正

  1. LLaVA-Plusは対応していますが、画像認識があまりよろしくありませんでした。
    → 解決策: Qwen2.5-VLを使用
  2. Seleniumは非同期対応していませんでした。
    → 解決策: Playwrightを使用します。

補足

  1. Qdrantには組み込みとサーバー型がありますが、組み込みにします。
  2. ツールには、マルチファイルワークスペース、キャンバス、イメージジェネレート、search with rag、search with internetを作ります。
  3. Search with Internetでは、DuckDuckGoで検索します。

質問です
なぜわざわざ古いqwenを使うんですか

Qwen3.5-2Bが今のところqwen系で一番いいと思います
ちなみにvlって名前はないけど機能自体はもともとある

訂正

  1. Qwen2.5-VLは古かったです。
    ->Qwen3-VLを使用します。

いや、VL系統が一番いいのです
マルチモーダル重視だから

qwen3.5は全部vl付きみたいなもんだよ
どっかの情報によると3 vlからとんでもなく良くなってるとか


うっ…

訂正

  1. Qwen3-VLは古かったです。
    → 解決策: Qwen3.6-Plusを使います

qwen3.6はhuggingにないよ

api経由でしか無理だと思うんだけどなあ

何が?????

qwen3.6が

それはそうなんだけど
qwen3.6ってapiじゃないと使えないんですよ
huggingfaceに3.5があって3.6がないならそういうことです

制限を、突破する
Ollamaで

多分それの中身3.5
わからないけどね!