1. 総括
Agents-A1-4B は、上海人工智能実験室(InternScience)が 2026 年 7 月 14 日に公開した 4B パラメータのデンス型エージェントモデルである。長期的検索(Long-horizon Search)、工学・科学研究、指示追従、ツール呼び出しの 5 領域にまたがる異種エージェント能力を備え、同規模の Qwen3.5-4B を大きく上回るスコアを複数ベンチマークで記録している。特に XBench-DS-2510(90.0)、GAIA(95.1)、IFEval(94.8)では同規模モデル中最高値を達成し、BrowseComp・FrontierScience-Research 等では大型 MoE モデル(Nex-N2-mini、Qwen3.6)に肉薄あるいは上回る数値を示した。262K コンテキスト、SGLang / vLLM 対応、Apache-2.0 ライセンスにより、ローカル環境での AI アシスタント構築やエージェント型ワークフローの組み込みに適している。
2. 各種ベンチマーク
以下は Hugging Face モデルカード「Performance」節に掲載の数値である。🥇 は同テーブル内最高値。
| ベンチマーク | Qwen3.5-4B | Agents-A1-4B | Qwen3.5 | Qwen3.6 | Nex-N2-mini | Agents-A1 (35B-A3B) |
|---|---|---|---|---|---|---|
| 長期的検索 | ||||||
| BrowseComp | 47.2 | 66.8 | 61.0 | 67.9 | 74.1 | 🥇 75.5 |
| XBench-DS-2510 | 73.0 | 🥇 90.0 | 77.0 | 71.0 | 82.0 | 86.0 |
| Seal0 | 31.5 | 45.8 | 41.4 | 38.7 | 49.6 | 🥇 56.4 |
| GAIA | 58.3 | 95.1 | 59.8 | 78.6 | 82.5 | 🥇 96.0 |
| 工学・研究タスク | ||||||
| SciCode | 16.1 | 29.6 | 37.7 | 35.8 | 29.9 | 🥇 44.3 |
| MLE-Lite | 7.6 | 22.7 | 24.2 | 34.9 | 34.9 | 🥇 43.9 |
| LiveCodeBench-V6 | 55.8 | 59.6 | 76.2 | 🥇 78.1 | 59.1 | 76.2 |
| FrontierScience-Research | 1.7 | 33.3 | 2.5 | 2.9 | 5.0 | 🥇 40.0 |
| 指示追従 | ||||||
| IFBench | 59.2 | 69.1 | 70.2 | 64.4 | 54.1 | 🥇 80.6 |
| LongBench-v2 | 50.0 | 52.1 | 59.0 | 57.7 | 59.6 | 🥇 60.2 |
| IFEval | 89.8 | 🥇 94.8 | 91.9 | 91.3 | 88.4 | 🥇 94.8 |
| 汎用・科学エージェント | ||||||
| τ²-Bench | 79.9 | 78.2 | 🥇 81.2 | 79.0 | 74.5 | 79.8 |
| VitaBench | 22.0 | 🥇 40.3 | 31.9 | 35.6 | 23.0 | 38.8 |
| MatTools | 10.9 | 🥇 49.3 | 21.0 | 15.9 | 34.1 | 47.1 |
出どころ:Hugging Face モデルカード「Performance」節。
3. 公式の発表
- 2026.7.14:4B モデル(Agents-A1-4B)を公開。
- 2026.7.8:コミュニティの要望に応え、数日以内に 4B モデルをリリースすると予告。
- 2026.7.2:Agents-A1 系列の量子化モデル変種を公開。mlx-community による Mac 向け複数スケールの量子化版も提供。
- 2026.6.26:フラッグシップの Agents-A1 35B-A3B モデル、選択領域の評価コード、技術レポート(arXiv:2606.30616)をオープンソース化。
出どころ:Hugging Face モデルカード「🔥 News」節。
4. 実際の性能(コミュニティ評価)
十分な情報がまだ集まっていない。
5. おすすめパラメータ
Hugging Face モデルカード「Recommended Sampling Parameters & System Prompt」節で推奨される生成パラメータは以下の通り。
| パラメータ | 推奨値 |
|---|---|
| temperature | 0.85 |
| top_p | 0.95 |
| top_k | 20 |
| min_p | 0.0 |
| presence_penalty | 1.1 |
| repetition_penalty | 1.0 |
また、モデルカードには推奨システムプロンプト(「You are Intern-A1, a deep research assistant developed by InternAgent Team, Shanghai Artificial Intelligence Laboratory. …」)が併記されている。マルチターン動作の安定化を目的とした設定である。
6. 情報源
2. ブンリンベンチ(ブンリンラボ独自テスト)
データなし(実施予定)。手法はブンリンベンチについてを参照。