タイトルの通リ。
トマトの作りたいものが多すぎるよ
お願いだから一つのプロジェクトに集中して作りきって欲しい
前のトピックではモデル選びに迷走していたらしい
LLaVA→LLaVA-Plus→Qwen2.5-VL→Qwen3-VL→Qwen3.6-Plus→Qwen3.5-Omni-Plus→Qwen3.5-9B?
v2なのか2.0なのか
どう見ても日本語じゃん
トマトくんの作りたいのなんだろう..
https://forum.kaisaba.net/t/topic/1545/
https://forum.kaisaba.net/t/topic/1535/
https://forum.kaisaba.net/t/topic/1504/
https://forum.kaisaba.net/t/topic/1453
https://forum.kaisaba.net/t/topic/1505/
今見つけた中ではこれぐらい
一番下の2つ以外何言ってるのか分からない
というわけで作っていきましょう?
この世代では、画像認識、画像生成などを使ったものである。
Steps
- 計画を50文字で作らせる。
- メインモデルの実行
- RAGの呼び出し
- ツールチェーンの呼び出し(pipelineなど)
- ハルシネーション対策の開始
- RAGの呼び出し
- 反論の生成
- メインモデルにお返し(10回まで行う)
- 全ステップ結論の生成
Models
メインモデル: LLaVA(Llama + 画像認識)
画像生成: Stable Diffusion 3.5
ControlNet: T2I-Adapter
Frameworks
基本推論周辺: LangGraph
RAG: Qdrant
補足
RAGの情報元: LlamaIndex
エージェント検索時のモデルへの情報提供方法: Seleniumでサイトのレンダリング + Turndown
作成時の注意
現状、テストするためのリソースがありません。
べーこん、リソース貸してください!
SDXLとQwen 3.6 35B A3B!
Qwen 3.6 35B A3Bだけでメモリかつかつなので両方動かしてほしいならどっちか削らないといけないよ
おおおおおおおあああああああああああああ My PPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPPCCCCCCCCCCCCCCCCCCCCCCCCCCCC
翻訳しないでください。これは日本語です。今日は世界
いらねーよこんな翻訳

