この世代では、画像認識、画像生成などを使ったものである。
Steps
- 計画を50文字で作らせる。
- メインモデルの実行
- RAGの呼び出し
- ツールチェーンの呼び出し(pipelineなど)
- ハルシネーション対策の開始
- RAGの呼び出し
- 反論の生成
- メインモデルにお返し(10回まで行う)
- 全ステップ結論の生成
Models
メインモデル: LLaVA(Llama + 画像認識)
画像生成: Stable Diffusion 3.5
ControlNet: T2I-Adapter
Frameworks
基本推論周辺: LangGraph
RAG: Qdrant
補足
RAGの情報元: LlamaIndex
エージェント検索時のモデルへの情報提供方法: Seleniumでサイトのレンダリング + Turndown
これを無事リリースできるかわからないけど、なんで僕が作る物って世代変わると色々変わるんだ?
TomaAI Classic 2.0もそうだし
まあ少なくともTomaAI Client系統は既存モデルの組み合わせという点では同じだね
bac0n
6
Qwen3.5-2Bが今のところqwen系で一番いいと思います
ちなみにvlって名前はないけど機能自体はもともとある
いや、VL系統が一番いいのです
マルチモーダル重視だから
bac0n
9
qwen3.5は全部vl付きみたいなもんだよ
どっかの情報によると3 vlからとんでもなく良くなってるとか
bac0n
17
それはそうなんだけど
qwen3.6ってapiじゃないと使えないんですよ
huggingfaceに3.5があって3.6がないならそういうことです