GPT-5.6 (Sol / Terra / Luna) is now evaluated on TrustVector โ€” with day-1 independent verification, incl. METR's benchmark-cheating findings.

Read the evaluation
Evaluation record ยท babyagi

BabyAGI

vClassic

Yohei Nakajima

Agentautonomousexperimentalopen-sourcearchived
66
Adequate
About This Agent

ARCHIVED: the original BabyAGI repo was archived to babyagi_archive in September 2024 and replaced by an experimental self-building framework; it is not production-maintained. Originally a minimalist autonomous task-driven AI agent that created, prioritized, and executed tasks toward an objective, demonstrating AGI concepts in under 200 lines of code.

Last Evaluated: July 9, 2026
Official Website

Trust Vector Analysis

Dimension Breakdown

๐Ÿš€Performance & Reliability
+
task completion accuracy

Based on community testing and demonstrations

Evidence
Community Experiments โ€” Task completion highly dependent on goal clarity and complexity
mediumVerified: 2026-07-09
tool use reliability

Tool integration assessment

Evidence
Tool Integration โ€” Limited tool support in classic version, extensions add capabilities
mediumVerified: 2026-07-09
multi step planning

Planning capability testing

Evidence
Task Management System โ€” Creates and manages task list based on objective
mediumVerified: 2026-07-09
memory persistence

Memory system evaluation

Evidence
Pinecone Integration โ€” Vector database (Pinecone) for task context storage
mediumVerified: 2026-07-09
error recovery

Error handling testing

Evidence
Code Review โ€” Minimal error handling, can fail or loop indefinitely
lowVerified: 2026-07-09
task generation

Task generation assessment

Evidence
Task Creation โ€” Can generate new tasks based on results, sometimes overgenerates
mediumVerified: 2026-07-09
๐Ÿ›ก๏ธSecurity
+
tool sandboxing

Security architecture review

Evidence
Architecture Review โ€” No sandboxing in classic version, executes tasks via LLM only
mediumVerified: 2026-07-09
access control

Access control assessment

Evidence
Simple Architecture โ€” Minimal access control, relies on API key security
mediumVerified: 2026-07-09
prompt injection defense

Injection attack testing

Evidence
Security Concerns โ€” Vulnerable to injection through objective and task results
lowVerified: 2026-07-09
data isolation

Data architecture review

Evidence
Vector Database โ€” Namespace-based isolation in Pinecone
mediumVerified: 2026-07-09
open source transparency

Source code review

Evidence
GitHub Repository โ€” MIT licensed, 20k+ stars, extremely simple and transparent code
highVerified: 2026-07-09
๐Ÿ”’Privacy & Compliance
+
data retention

Privacy architecture review

Evidence
Pinecone Storage โ€” Data retention controlled by Pinecone configuration
mediumVerified: 2026-07-09
gdpr compliance

Compliance capabilities assessment

Evidence
Third-Party Dependencies โ€” GDPR compliance depends on Pinecone and OpenAI configurations
mediumVerified: 2026-07-09
third party data sharing

Data flow analysis

Evidence
External Services โ€” Data sent to OpenAI API and Pinecone vector database
mediumVerified: 2026-07-09
local deployment option

Deployment options assessment

Evidence
Code Variants โ€” Variants exist for local LLMs but require code modifications
mediumVerified: 2026-07-09
๐Ÿ‘๏ธTrust & Transparency
+
documentation quality

Documentation completeness review

Evidence
README Documentation โ€” Basic README, code is self-documenting due to simplicity
mediumVerified: 2026-07-09
execution traceability

Logging capabilities assessment

Evidence
Console Output โ€” Prints task execution to console with results
mediumVerified: 2026-07-09
decision explainability

Explainability features assessment

Evidence
Task Visibility โ€” Task list and results visible, shows reasoning for new tasks
mediumVerified: 2026-07-09
open source code

Open source assessment

Evidence
GitHub Repository โ€” MIT licensed, 20k+ stars, under 200 lines of highly readable code
highVerified: 2026-07-09
code simplicity

Code complexity analysis

Evidence
Source Code โ€” Remarkably simple implementation, easy to understand and modify
highVerified: 2026-07-09
โš™๏ธOperational Excellence
+
ease of integration

Integration complexity assessment

Evidence
Setup Instructions โ€” Very simple setup, just API keys and Python dependencies
highVerified: 2026-07-09
scalability

Scalability testing

Evidence
Architecture Limitations โ€” Not designed for production scale, single-threaded execution
mediumVerified: 2026-07-09
cost predictability

Cost analysis

Evidence
Token Usage โ€” Can generate many tasks leading to unpredictable API costs
mediumVerified: 2026-07-09
monitoring capabilities

Monitoring features assessment

Evidence
Logging Features โ€” Basic console output, no production monitoring tools
mediumVerified: 2026-07-09
production readiness

Production readiness assessment

Evidence
Project Purpose โ€” Designed as concept demonstration, not production system
GitHub Repository Status โ€” Re-verified 2026-07-09: original repo remains archived in babyagi_archive (snapshot Sept 2024); current babyagi repo is an experimental self-building framework, not production-maintained
highVerified: 2026-07-09
Strengths
  • +Extremely simple and elegant demonstration of AGI concepts
  • +Under 200 lines of code, easy to understand and modify
  • +Pioneered task-driven autonomous agent approach
  • +Great educational tool for learning agent concepts
  • +Open source with complete transparency
  • +Low barrier to entry for experimentation
Limitations
  • !Not production-ready, designed as concept demonstration
  • !Minimal error handling and recovery capabilities
  • !Can generate excessive tasks leading to high costs
  • !No built-in security or sandboxing features
  • !Limited tool integration in classic version
  • !Unpredictable behavior and task completion quality
  • !Archived (Sept 2024): original repo moved to babyagi_archive with no further maintenance
Metadata
license: MIT
supported models
0: OpenAI GPT-4
1: GPT-3.5
2: GPT-3
programming languages
0: Python
deployment type: Self-hosted (local script)
tool support
0: Limited, primarily LLM-based task execution
github stars: 20737+
first release: 2023
code lines: ~140 (classic version)
status: Archived as of September 2024

Use Case Ratings

customer support

Too unpredictable and experimental for customer support

code generation

Limited code generation capabilities, lacks necessary tools

research assistant

Can break down research tasks but execution quality varies

data analysis

Minimal data analysis capabilities in classic version

content creation

Can generate content tasks but quality control challenging

education

Too experimental for educational applications

healthcare

Completely unsuitable for healthcare due to reliability concerns

financial analysis

Lacks security, compliance, and reliability for financial use

legal compliance

Too unreliable for legal work requiring accuracy

creative writing

Best suited for creative exploration and concept generation