Codendum

Infrastruttura locale e condivisa per i coding agent, per classi e team. Un solo NVIDIA GB10 (DGX Spark) esegue vLLM con un modello open weight e gli utenti lavorano con OpenCode dalle proprie postazioni. Sviluppato da Stefano Noferi.

AIOpen SourcevLLMOpenCodeDGX SparkApache 2.0

Cos’è Codendum

Codendum permette di condividere una sola macchina che fa inferenza con modelli open weight per il coding generativo. Un sistema NVIDIA GB10 (DGX Spark o equivalente) esegue vLLM con un modello di coding e più utenti in contemporanea usano OpenCode sulle proprie postazioni. Funziona allo stesso modo per un’aula o per un team aziendale: i prompt e i sorgenti restano sulla rete dell’organizzazione.

Il repository contiene script, configurazioni di esempio e documentazione per installare il servizio, metterlo in sicurezza, testarlo, misurarlo e gestirlo.

Come funziona

  • Il GB10 fa solo inferenza. Codice, version control, compilatori, build e test restano sulle postazioni degli utenti o in ambienti di sviluppo isolati, qualunque sia il linguaggio.
  • Tutto gira in Docker. vLLM ascolta solo su 127.0.0.1; l’unico ingresso è un container nginx che accetta HTTPS su una porta dedicata dalla LAN o dalla VPN, verifica una API key per utente, applica limiti per utente e inoltra solo /v1/chat/completions e /v1/models.
  • OpenCode usa un provider compatibile con le API OpenAI, con tool calling abilitato esplicitamente e limite di contesto allineato al profilo del server.

Il modello di riferimento è Qwen3-Coder-30B-A3B-Instruct-FP8; immagini dei container e modello sono fissati per digest.

Misure

La pagina Benchmarks della documentazione riporta le misure fatte su un GB10 con una classe simulata di utenti OpenCode concorrenti, come riferimento per quel modello e quella versione del client.

Limiti dichiarati

Una sola macchina, senza alta disponibilità; nessuna quota di token per utente; la cache dei prefissi condivisa espone a un possibile timing side channel; i permessi di esecuzione del codice dipendono dalla configurazione del client. Il threat model e le responsabilità sono descritti nella pagina Security and limits della documentazione.

Roadmap

Un possibile passo successivo è la governance dei contenuti che passano dal modello (redaction dei dati personali, firewall anti prompt injection, interruzione dei loop degli agenti, audit log tamper-evident) tramite l’integrazione di Admina come gateway tra proxy e vLLM. L’integrazione non è ancora implementata.

Il ruolo di noze

Codendum è un progetto creato e mantenuto da Stefano Noferi, fondatore di noze. La versione 0.1.0 è uscita il 29 settembre 2026, seguita dalla 0.1.1 il 1° ottobre 2026. Il racconto del rilascio è sul blog di Stefano Noferi.

Licenza

Codendum è distribuito sotto Apache License 2.0. Immagini dei container, pesi del modello e software client si scaricano separatamente e mantengono le proprie licenze.

Vuoi supporto?Sei sotto attacco?Stato dei servizi
Vuoi supporto?Sei sotto attacco?Stato dei servizi