じゃあTomaAI Client 2.0を作ります?

タイトルの通リ。

トマトの作りたいものが多すぎるよ
お願いだから一つのプロジェクトに集中して作りきって欲しい

前のトピックではモデル選びに迷走していたらしい

LLaVA→LLaVA-Plus→Qwen2.5-VL→Qwen3-VL→Qwen3.6-Plus→Qwen3.5-Omni-Plus→Qwen3.5-9B?

https://forum.kaisaba.net/t/topic/1167

v2なのか2.0なのか


そうなの?

どう見ても日本語じゃん

トマトくんの作りたいのなんだろう..

https://forum.kaisaba.net/t/topic/1545/
https://forum.kaisaba.net/t/topic/1535/
https://forum.kaisaba.net/t/topic/1504/
https://forum.kaisaba.net/t/topic/1453
https://forum.kaisaba.net/t/topic/1505/

今見つけた中ではこれぐらい

一番下の2つ以外何言ってるのか分からない

というわけで作っていきましょう?
この世代では、画像認識、画像生成などを使ったものである。

Steps

  1. 計画を50文字で作らせる。
  2. メインモデルの実行
  3. RAGの呼び出し
  4. ツールチェーンの呼び出し(pipelineなど)
  5. ハルシネーション対策の開始
  6. RAGの呼び出し
  7. 反論の生成
  8. メインモデルにお返し(10回まで行う)
  9. 全ステップ結論の生成

Models

メインモデル: LLaVA(Llama + 画像認識)
画像生成: Stable Diffusion 3.5
ControlNet: T2I-Adapter

Frameworks

基本推論周辺: LangGraph
RAG: Qdrant

補足

RAGの情報元: LlamaIndex
エージェント検索時のモデルへの情報提供方法: Seleniumでサイトのレンダリング + Turndown

作成時の注意

現状、テストするためのリソースがありません。
べーこん、リソース貸してください!
SDXLとQwen 3.6 35B A3B!

Qwen 3.6 35B A3Bだけでメモリかつかつなので両方動かしてほしいならどっちか削らないといけないよ

おおおおおおおあああああああああああああ My PPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPCCCCCCCCCCCCCCCCCCCCCCCCCCCC
翻訳しないでください。これは日本語です。今日は世界


うーんこの

いらねーよこんな翻訳