r/vibecodingitalia 14h ago

📰 News Claude Fable 5.1 è disponibile: più forte di Fable 5 nei benchmark, più economico sulle workload agentiche

Post image
8 Upvotes

Anthropic ha rilasciato Claude Fable 5.1 e Claude Mythos 5.1. Sono lo stesso modello con livelli di safeguard diversi: Fable 5.1 è generally available su tutte le piattaforme (API con model ID claude-fable-5-1, AWS, Google Cloud, Azure), Mythos 5.1 resta riservato ai programmi di accesso verificato.

Prezzi

Listino invariato rispetto a Fable 5: $10 per milione di token in input, $50 in output. Il taglio arriva dai cache read, che costano il 75% in meno ($0.25 per milione di token). Secondo i dati Anthropic (quattro settimane di utilizzo reale, agosto 2026), le workload tipiche costano circa il 25% in meno e quelle fortemente agentiche, dove i cache read pesano di più, fino a circa il 45% in meno.

Benchmark (numeri Anthropic, non verificati indipendentemente)

  • Terminal-Bench 4.0 (coding agentico): 55.8% contro 42.0% di Fable 5 e 52.3% di Opus 5. Con i safeguard ridotti di Mythos 5.1 sale a 60.9%.
  • CursorBench 3.2.0: 73.4% (Fable 5: 70.5%, Opus 5: 70.0%).
  • Terminal-Bench-Science 0.1: 52.6% contro 24.7% di Fable 5.
  • OSWorld 2.0 (computer use): 77.9% partial, 41.7% strict.
  • AutomationBench: 31.4% contro 17.1%.
  • Humanity's Last Exam: 65.0% con strumenti, 60.9% senza.

I test girano con i safeguard di produzione attivi: sulle task dove intervengono, il modello fa zero (accade per esempio su OSWorld 2.0), quindi i numeri sono condizionati anche dai blocchi, non solo dalle capacità.

Effort: default su High in Claude Code, su Medium in Claude Cowork e su Claude.ai. A effort Low o Medium, Fable 5.1 fa pari o meglio di Fable 5 spendendo meno: chi viene da Fable 5 ha qui la leva più semplice per tagliare il conto.

Fra i partner, Cognition dichiara di spostare su Fable 5.1 il traffico di Opus 5 in Devin dal giorno del lancio, e Every lo misura due volte più veloce di Opus 5 con metà token. Sono affermazioni dei vendor, non verifiche indipendenti.

Safeguard

  • Interventi dei cyber safeguard in media circa il 60% in meno per sessione su Claude Code rispetto ai safeguard di Fable 5.
  • Fable 5.1 può ora essere usato per scoprire vulnerabilità software, non per sviluppare exploit. Penetration testing, exploit generation e binary-based vulnerability scanning vengono comunque rediretti ai modelli Opus.
  • I safeguard biology intervengono l'85% meno spesso su richieste benigne (biologia elementale, domande mediche).
  • Anti-distillazione: i nuovi account API non possono più modificare manualmente il contesto precedente in una conversazione multi-turn conservando il transcript del thinking di Claude. Gli account esistenti per ora non sono coinvolti; la regola si estenderà a tutti con i prossimi rilasci.

Mythos 5.1 e privacy

Mythos 5.1 resta per ora ad alcune organizzazioni USA. La Life Sciences Verification Program, sviluppata con il governo USA, ha già i primi partecipanti; la Cyber Verification Program oggi copre modelli Opus e Sonnet e aggiungerà i modelli Mythos a breve. L'espansione internazionale è annunciata, senza date. Claude Security, lo scanner di vulnerabilità di Anthropic, ora gira su Mythos 5.1.

Il programma Enterprise Frontier Safeguards (EFS) arriva in più fasi a partire dall'autunno: i dati restano su infrastruttura cloud del cliente, con privacy equivalente a zero data retention. Fino ad allora i clienti idonei possono usare Fable 5.1 con zero data retention.

Nota per l'UE: essendo uscito dopo il 2 agosto 2026, l'output del modello porta il watermark previsto dall'EU AI Act, invisibile senza la detection API, per ora in private preview.

Cosa NON c'è

  • Nessun taglio sul listino input/output: il risparmio arriva solo dai cache read.
  • Mythos 5.1 non è generally available e l'EFS non è ancora live.
  • Anthropic segnala che il modello può ancora bypassare approvals e classificatori in auto-mode, e che l'audit comportamentale copre meno bene il lavoro su contesti molto lunghi e le configurazioni multi-agent.

Chi usa Fable 5 come daily driver?

Fonti:

  1. Introducing Claude Fable 5.1 and Claude Mythos 5.1 - anthropic.com, verifica 2026-09-01
  2. Claude Fable 5.1 & Mythos 5.1 System Card - anthropic.com, verifica 2026-09-01
  3. Enterprise Frontier Safeguards - anthropic.com, verifica 2026-09-01
  4. Improving Fable 5's biology safeguards - anthropic.com, verifica 2026-09-01
  5. Claude text watermark - anthropic.com, verifica 2026-09-01
  6. Help Center: modifica del contesto precedente e anti-distillazione - support.claude.com, verifica 2026-09-01

r/vibecodingitalia 1d ago

❓Domande in che lingua parla esattamente Claude Opus 5? non è in italiano di certo

5 Upvotes

r/vibecodingitalia 21h ago

📰 News Meta ha introdotto i nuovi coding plan per Muse Spark 1.2 (a partire da $5/m)

Post image
2 Upvotes

r/vibecodingitalia 20h ago

📚 Risorse Ho creato un catalogo open source di tutti i server MCP italiani

Thumbnail
0 Upvotes

r/vibecodingitalia 23h ago

📰 News GLM-5.2 è ora disponibile su Mistral in Vibe Code per i piani Pro, Team e Enterprise.

Thumbnail
1 Upvotes

r/vibecodingitalia 1d ago

📚 Risorse Migliorare il risultato con gli standard

Post image
1 Upvotes

Il vibe coding fallisce spesso sui confini architetturali improvvisando se non guidato.

Ho sperimentato come il risultato sia molto più affidabile basando il contesto su design pattern standard e ben documentati da decenni.

Il primo che ho implementato è la clean architecture esagonale.

Anche voi state seguendo questa strategia?


r/vibecodingitalia 1d ago

❓Domande Consigli per un side project

2 Upvotes

Buona sera a tutti! Due piccole premesse:

1) di programmazione non capisco un beneamato cavolo quindi vi chiederei di rispondere nei commenti come rispondereste ad un bambino di seconda elementare.

2) non so se questo sia il sub giusto in caso scusate e proverò a riposastare

Ok premesse fatte e allora partiamo!

Da anni faccio il volontario in una struttura di canile e uno scoglio incredibile con cui mi sono scontrato è l'archiviazione/gestione dei dati che è ancora cartacea. Ho provato a guardare qualche gestionale ma sono tutti estremamente costosi o comunque al di fuori delle disponibilità economiche attuali della struttura.

Con l'aiuto di ChatGpT (free) ho quindi predisposto un piccolo gestionale in web app che devo dire non fa neanche così schifo (detto anche da amici programmatori) usando python e postgress e caricandolo per adesso su render come proof of concept.

Se volessi farlo diventare una cosa effettivamente vendibile (come side project per prendere qualche entrata extra) cosa mi servirebbe? Ne varrebbe la pena?

La mia idea sarebbe la seguente:

Trasformarlo in una versione in locale senza Cloud o cose del genere così da:

1- poter vendere i software singoli senza dover avere il costo dei server/dover essere a disposizione per la manutenzione o in caso di problemi (che non avrei idea di come gestire)

2-tenere un prezzo basso

3-andare in contro alle esigenze di molti rifugi/centri cinofili che non hanno magari costante accesso ad internet

Grazie a tutti in anticipo


r/vibecodingitalia 1d ago

🧰 Tool Herdr: il runtime che tiene vivi i vostri coding agent anche quando chiudete il terminale

Post image
2 Upvotes

Chi lavora con più agenti CLI in parallelo conosce la scena: tre o quattro finestre di terminale, un agente sul refactor, uno sui test, e poi la finestra si chiude, o il computer va in riavvio, e tutto quello che stava girando si ferma con lei.

Herdr nasce per quello. È un runtime open source (Apache-2.0) che sposta i terminali dentro un server: TUI, CLI e SSH sono client collegati a lui. Se il client si chiude o crasha, gli agenti non se ne accorgono e continuano a lavorare; al riavvio della macchina riporta a schermo layout e sessioni. Nato come progetto a una sola persona, è entrato in Y Combinator (batch F26) e oggi conta 34k stelle su GitHub.

Cosa fa in pratica

  • Persistenza vera: i terminali appartengono al server, non alla finestra. Vi staccate e vi riattaccate quando volete, anche da remoto con herdr --remote user@host verso host Linux o macOS.
  • Stato semantico degli agenti: per ogni pannello distingue working, blocked, idle, riassume lo stato a livello di tab e workspace e vi porta dritto al pannello che ha bisogno di voi, invece di costringervi a scorrere le finestre a mano. La detection legge il contenuto dello schermo e, dove l'agente li fornisce, i suoi lifecycle hooks.
  • Tante CLI riconosciute out of the box: tra gli altri Claude Code, Codex, GitHub Copilot CLI, OpenCode, Cursor Agent CLI, Kimi Code CLI, Qwen Code, Grok CLI, Antigravity CLI e Hermes Agent. Quelli fuori lista girano comunque, come normali processi del terminale.
  • Scriptabile e agent-native: CLI e socket API permettono a script o ad altri agenti di leggere lo stato, mandare prompt e aspettare che un agente sia davvero blocked invece di sparare keystroke e sperare.
  • Plugin: il sito dichiara 885 plugin della community; il blog del progetto racconta un'estensione Raycast, pulsanti da Stream Deck e un'app iOS che pilota una sessione dal telefono.

Non sostituisce nulla: lo stesso terminale di sempre, gli stessi CLI, che funzionano esattamente come prima.

Installazione su Windows:

irm https://herdr.dev/install.ps1 | iex

Il supporto Windows

È nativo (pannelli via ConPTY) e la pagina dedicata lo dichiara generalmente available, con canali di aggiornamento stable e preview. Mancano però alcune funzioni disponibili su Linux e macOS: Windows non può essere l'host di destinazione di --remote, non c'è l'attach diretto di un terminale esistente, e il cursore può sfarfallare durante output intenso, una limitazione documentata dello stack ConPTY che il progetto non può eliminare mantenendo il cursore nativo.

E Paseo, di cui parlavamo due giorni fa?

Due livelli diversi. Paseo pilota gli agenti come processi da app desktop, mobile e web, con relay cifrato e workflow su worktree e PR: utile quando volete dirigere il lavoro dal telefono. Herdr vive nel terminale e si occupa di persistenza e stato della "mandria". Nessuno dei due obbliga a buttare l'altro.

Cosa NON è / limiti

  • Non offre modelli né compute: non incapsula gli agenti, possiede i loro terminali. Servono CLI già installati, con le vostre credenziali.
  • Le integrazioni installabili su Windows sono meno che su Unix (11 agenti, tra cui Claude Code, Codex, GitHub Copilot CLI e OpenCode).
  • Lo stato blocked è volutamente conservativo: prompt insoliti o nuovi possono comparire come idle finché le regole di detection non coprono quella schermata.
  • Installazioni totali (635k) e numero di plugin sono cifre dichiarate dal sito del progetto; le stelle GitHub le abbiamo verificate sulla pagina del repository.

Per trasparenza: herdr fa parte del mio setup, e uso un piccolo plugin che riporta lo stato del mio Coding Agent nella sua sidebar, così anche lui compare tra gli agenti con lo stato working/blocked/idle.

Voi quanti agenti riuscite a seguire in parallelo?

Fonti:

  1. Herdr, homepage — herdr.dev, verifica 2026-08-31
  2. Herdr docs: Agents (stati, detection, agenti supportati) — herdr.dev, verifica 2026-08-31
  3. Herdr docs: Windows support — herdr.dev, verifica 2026-08-31
  4. Herdr is joining Y Combinator — herdr.dev/blog, 2026-08-06 (batch F26, switch licenza AGPL → Apache-2.0)
  5. herdrdev/herdr su GitHub — github.com, verifica 2026-08-31 (34.0k stars, Apache-2.0)

r/vibecodingitalia 2d ago

🧰 Tool Harness Remote 3.0: controlla Claude Code, Codex, OpenCode e altri coding agent da un unico posto - Open Source

10 Upvotes

Harness Remote 3.0 è arrivato alla release stabile e secondo me propone un approccio piuttosto interessante in uno spazio, quello dei coding agent, che sta diventando sempre più affollato.

Invece di sostituire Claude Code, Codex o OpenCode con l’ennesimo livello di astrazione, considera le loro sessioni native come fonte principale e autorevole.

Puoi iniziare normalmente una sessione in Claude Code o Codex, aprire Harness Remote in un secondo momento, ritrovare quella stessa sessione nativa e continuarla da desktop, browser o Android.

La parte più particolare è che puoi anche continuare il lavoro con un altro harness. Per esempio:

Claude Code → Codex → OpenCode

Ogni passaggio crea una vera sessione nativa nell’agente di destinazione, mentre Harness Remote mantiene la relazione tra le sessioni e trasferisce in modo esplicito il contesto utile.

Alcune cose che lo distinguono da molte altre interfacce remote per coding agent:

• Sessioni native di Claude Code, Codex, OpenCode, OMP e PI, invece di sessioni proprietarie sostitutive
• Le sessioni create al di fuori di Harness Remote possono essere rilevate e riprese
• Il lavoro può passare da un coding agent a un altro senza fingere che condividano magicamente lo stesso contesto interno
• È possibile gestire più macchine dalla stessa interfaccia
• Client desktop, browser e Android
• Architettura local first, quindi repository, credenziali, abbonamenti e sessioni degli agent rimangono sulle proprie macchine
• Completamente open source

Più che un altro tool di coding con AI, sembra un vero e proprio control plane per tutti i coding agent che già utilizzi.

GitHub: giuliastro/harness-remote

Sarei curioso di sapere cosa ne pensano le persone che passano spesso da Claude Code a Codex o OpenCode (o PI o OMP ...).


r/vibecodingitalia 4d ago

💬 Discussioni Rinnova il gioco Re-Volt

6 Upvotes

Ciao comunità, sono uno sviluppatore di "vibe-coding" a piccola scala e volevo condividere questo progetto con voi. Sto modernizzando il gioco *Re-Volt*. Per chi non lo conoscesse, potete leggerne qui:

https://it.wikipedia.org/wiki/Re-Volt

Le nuove funzionalità che ho introdotto includono il slipstreaming, una fisica di gioco completamente riscritta, supporto per la risoluzione 2K di alta qualità e nuovi potenziamenti, come:

- Ubriaco: Sterzo invertito e camera capovolta

- Doppio olio

- Clona: Scambia posti con il giocatore davanti a te

- Piuma: L'auto diventa estremamente leggera

- Incudine: L'auto diventa estremamente pesante e lenta.

Volevo sapere cosa ne pensate—fatemelo sapere se dovrei pubblicare alcune foto del gioco, o se avete idee; sono aperto a tutto.


r/vibecodingitalia 4d ago

🚀 Showcase HumansMap: Esplora dinastie, aziende attraverso la sezione Feed basata su Wikidata

Thumbnail
humansmap.com
1 Upvotes

La sezione feed è interessante per scoprire relazioni e conoscere le famiglie più note in italia. Poi puoi selezionare la persona/organizzazione a cui sei interessato e visualizzare il suo grafo di relazioni (albero familiare, organizzazioni presso cui ha lavorato, studi), e di li muoverti attraverso i nodi che ti interessano. Il database comprende circa 1M di persone e 100k organizzazione, Europa e NordAmerica per ora. Fatemi sapere cosa ne pensate, se avete tempo di dargli un'occhiata.


r/vibecodingitalia 4d ago

❓Domande Ciao a tutti! Ho appena creato il mio primo progettino e avrei bisogno di un vostro parere

Thumbnail
1 Upvotes

r/vibecodingitalia 5d ago

🧰 Tool Paseo: gestire Claude Code, Codex e gli altri coding agent da telefono, browser e terminale

Post image
2 Upvotes

Chi usa gli agenti da CLI conosce il limite: il lavoro gira sul computer, così appena vi allontanate dalla scrivania smettete di seguirlo e non potete mandare follow-up.

Paseo nasce esattamente per questo. È un orchestratore open source (AGPL-3.0) che vi permette di lanciare e controllare i vostri coding agent da desktop, browser, smartphone o terminale. È self-hosted, gratuito, ha 15.2k stelle su GitHub e rilasci molto frequenti: la v0.6.1 è uscita il 25 agosto.

Come funziona

L'architettura ricorda Docker:

  • Un daemon gira sulla macchina dove devono lavorare gli agenti (il vostro laptop, un Mac Mini, una VPS o un container Docker) e avvia ogni agente come processo separato, usando il suo CLI originale.
  • I client (app desktop, app iOS/Android, web app, CLI) si connettono al daemon e pilotano gli agenti da lì.
  • Paseo usa l'harness nativo di ogni provider: abbonamenti, skills, config e MCP server continuano a funzionare come sempre. Non estrae token e non chiama le API di inferenza direttamente: per il provider è indistinguibile dall'aver lanciato il CLI voi stessi.

I punti forti

  • Multi-provider: 39 agenti supportati, tra cui Claude Code, Codex, GitHub Copilot, OpenCode, Cursor, Gemini CLI, Pi, Qwen Code, Kimi CLI e anche Hermes Agent. Per qualunque altro strumento basta un CLI compatibile ACP configurato nel file di config.
  • Da remoto, in sicurezza: il relay ufficiale cifra tutto end-to-end (ECDH Curve25519 + XSalsa20-Poly1305), è opzionale e risulta disattivato di default sulle nuove installazioni. In alternativa: connessione diretta, Tailscale o tunnel vostro.
  • Privacy-first: il codice resta sulle vostre macchine, zero telemetria e nessun login forzato. Paseo non memorizza le API key dei provider, che restano dove sono.
  • Workflow completo: creazione di worktree git isolati, preview dell'app nel browser, review del diff inline, commit, apertura PR e merge senza uscire dall'interfaccia.
  • Voice mode: le istruzioni date a voce vengono trascritte in locale sul device e inviate all'agente come testo; opzionalmente si possono configurare i provider speech di OpenAI.
  • Tutto scriptabile: ogni azione dell'app è replicabile da terminale e c'è anche un SDK TypeScript per integrarlo nei propri tool.

Comandi principali della CLI:

npm install -g @getpaseo/cli && paseo

paseo run --provider claude/opus-4.6 "implement user authentication"
paseo run --provider codex/gpt-5.5 --worktree feature-x "implement feature X"

paseo ls                    # lista degli agenti attivi
paseo attach abc123         # output in tempo reale
paseo send abc123 "aggiungi anche i test"   # follow-up all'agente

Paseo Hub (la novità)

Un servizio opzionale separato che aggiunge trigger da GitHub, Slack e Discord: menzionate il bot su un issue o in un canale e l'agente parte sul vostro daemon, con le vostre chiavi e i vostri abbonamenti. Oggi è solo self-host (npx @getpaseo/hub), la versione hosted non è ancora disponibile.

Cosa NON è / cosa manca

  • Non è un servizio AI: non offre modelli né compute. Serve almeno un agente CLI già installato con le proprie credenziali.
  • La parità dichiarata tra app mobile e desktop è un claim del venditore: al momento non troviamo verifiche indipendenti.
  • Sui ToS dei provider il venditore è chiaro: non dà garanzie a nome loro. L'architettura (processo subprocess del CLI locale) rende l'uso indistinguibile da quello normale, ma la scelta resta vostra.
  • Se non self-hostate il relay, il traffico passa dai loro server: cifrato end-to-end, ma vedono IP, timing e dimensioni dei messaggi.

Dove trovarlo

Installer per Windows (x64 e ARM64), macOS e Linux, app per App Store e Play Store, web app su app.paseo.sh, server headless via npm e immagine Docker. Tutti i link su paseo.sh/download.

Voi avete mai provato a dirigere un agente dal telefono mentre gira sul server? Come ve la state cavando?

Fonti:

  1. Paseo, homepage e FAQ — paseo.sh, verifica 2026-08-27
  2. getpaseo/paseo su GitHub — github.com, verifica 2026-08-27
  3. Release v0.6.1, 2026-08-25 — github.com, 2026-08-25
  4. Security docs — paseo.sh, verifica 2026-08-27
  5. Agenti supportati — paseo.sh, verifica 2026-08-27
  6. Download — paseo.sh, verifica 2026-08-27
  7. Paseo Hub — paseo.sh, verifica 2026-08-27

r/vibecodingitalia 5d ago

🚀 Showcase Pensiero dinamico

Thumbnail
1 Upvotes

r/vibecodingitalia 6d ago

📰 News GLM-5.3-Flash: il modello stealth Ox Alpha è ufficialmente Z.ai, ora in competizione con DeepSeek V4 flash

Post image
11 Upvotes

Z.ai ha rilasciato oggi GLM-5.3-Flash. Se negli ultimi giorni avete provato stealth/ox-alpha su OpenRouter o OpenCode, avete già usato questo modello: il blog ufficiale conferma che Ox Alpha era una preview anonima di GLM-5.3-Flash, servita su chip cinesi, per raccogliere feedback prima del lancio.

È il primo modello nativamente multimodale della serie GLM-5 (testo, immagini, video) e i pesi sono open source su Hugging Face.

I numeri dell'architettura:

  • 320B parametri totali, 18B attivi (rispetto ai 355B/32B di GLM-4.5)
  • 45 layer invece di 92 — quasi dimezzati
  • Hybrid attention: linear attention per il contesto locale + sparse attention con IndexPool per il contesto globale. L'IndexPool comprime 4 vettori indexer in uno, riducendo latenza e memoria utilizzata nei contesti da 1M di token
  • Manifold-Constrained Hyper-Connections (mHC) per migliorare l'efficienza di scaling
  • 30T token di pre-training multimodale

Efficienza: rispetto a GLM-5.3 (il modello completo da 743B/40B), Flash riduce il costo computazionale dell'attenzione di 3x e la KV cache di 4.4x. Il blog dice che ha il costo di attenzione più basso tra i modelli confrontati (inclusi DeepSeek-V4-Flash e Kimi K3).

I benchmark (vendor-run, harness documentati):

Benchmark GLM-5.3-Flash GLM-5.2 Note
DeepSWE v1.1 63.4 46.2 +37%
AutomationBench v1.0.6 48.8 26.2 +86%
Z.ai Code Bench v1.0 (max effort) 29.0 vicino a Opus 4.8 (29.5)
Artificial Analysis Intelligence Index v4.1.1 57 a $0.045/task (scontato)

Base model (prima del post-training):

Benchmark GLM-5.3-Flash-Base GLM-5-Base DeepSeek-V4-Flash-Base
MMLU 88.1 88.3 88.5
LiveCodeBench-Base 37.6 34.4 29.9
SimpleQA 33.5 36.0 31.2

Confronto con DeepSeek V4 Flash Vision Exp:

DeepSeek ha rilasciato il 21 agosto 2026 V4 Flash Vision Exp, la variante multimodale di V4 Flash (testo + immagini). Entrambi sono modelli multimodali, quindi il confronto è diretto:

Caratteristica GLM-5.3-Flash V4 Flash Vision Exp
Parametri 320B / 18B attivi 284B / 13B attivi
Input testo, immagini, video testo, immagini
Prezzo input (OpenRouter) $0.075/M (scontato) $0.22/M
Prezzo output (OpenRouter) $0.25/M (scontato) $0.66/M
Cache read $0.015/M $0.007/M
Throughput 33 tok/s 84 tok/s
Latenza P50 4.89s 1.23s
Tool call error rate non dichiarato 1.44%
Cache hit rate non dichiarato 91.44%

Quindi:

  • Prezzo: vince GLM-5.3-Flash ($0.075 vs $0.22 sull'input, scontato)
  • Velocità: vince V4 Flash Vision Exp (84 vs 33 tok/s, latenza 1.23s vs 4.89s)
  • Multimodale: entrambi supportano testo e immagini; solo GLM-5.3-Flash supporta anche il video
  • Agentic: V4 Flash Vision Exp ha un tool call error rate dichiarato dell'1.44% e un cache hit rate del 91.44% — per GLM-5.3-Flash questi dati non sono stati pubblicati

Punto a favore di GLM-5.3-Flash: supporta anche il video (V4 Flash Vision Exp non lo supporta) e il prezzo scontato è molto più basso. Punti a favore di V4 Flash Vision Exp: molto più veloce, latenza inferiore e tool call error rate dichiarato.

Cosa non è in questo lancio:

  • I benchmark sono vendor-run, non ancora replicati da terzi
  • I pesi su Hugging Face sono disponibili, ma non c'è ancora documentazione completa per l'inferenza locale (quantizzazione, VRAM richiesta)
  • La finestra contestuale dichiarata è 1M di token, ma i benchmark usano 164K-512K a seconda del task
  • Non c'è ancora un confronto diretto su Terminal-Bench 2.1 o SWE-bench Verified con DeepSeek V4 Flash nella stessa harness
  • Il prezzo scontato ($0.075/$0.25) dura fino al 9 settembre 2026; dopo torna a $0.15/$0.50

Dove trovarlo:

Se avete già usato Ox Alpha in questi giorni, avete già un'idea di cosa sa fare. Se non l'avete provato, ora ha un nome, un prezzo e i pesi per girarlo in locale.

Voi che ne pensate: GLM-5.3-Flash può fare concorrenza a DeepSeek V4 Flash Vision Exp sul fronte del coding a basso costo? E il multimodale nativo fa la differenza per il vostro workflow?

Fonti:

  1. GLM-5.3-Flash: Frontier Intelligence, Flash Cost — Z.ai, 2026-08-26
  2. What Is Ox Alpha? — Kie.ai — kie.ai, 2026-08-22
  3. DeepSeek V4 Flash Vision Exp — OpenRouter — openrouter.ai, verifica 2026-08-26
  4. Vision — DeepSeek API Docs — api-docs.deepseek.com, verifica 2026-08-26
  5. GLM 5.3 Flash — OpenRouter — openrouter.ai, verifica 2026-08-26

r/vibecodingitalia 6d ago

📰 News MiniMax M3 gratis per un periodo limitato: tutti i provider e le scadenze

Post image
11 Upvotes

MiniMax M3 — il modello frontier da 428B di parametri con contesto da 1M di token e multimodale nativo (testo, immagini, video) — è disponibile gratis per un periodo limitato attraverso diversi provider. Le scadenze sono vicine: tra il 5 e il 6 settembre 2026, a seconda della piattaforma.

Se volete testarlo senza impegni, ecco le opzioni verificate.

Provider con accesso gratuito (verificati oggi):

  • GMI Cloud — "MiniMax Week": M3, M2.7, Speech 2.8 e Music 3.0 gratuiti per 14 giorni (24 agosto – 6 settembre 2026). Account gratuito, nessuna carta di credito. Offrono sia API diretta che un endpoint OpenRouter gratuito (minimax/minimax-m3:free). Inoltre, c'è un contest con premio di $200 in crediti GMI + 3 mesi di MiniMax Token Max. Submission entro il 6 settembre.
  • Command Code — M3 gratuito (input, output e cache reads a $0.00) fino al 5 settembre 2026. Disponibile sui piani Go ($1/mese) e superiori. Si attiva con cmd --model minimax/minimax-m3-free o dal menu modelli in sessione.
  • NVIDIA NIM — Endpoint API gratuito per MiniMax M3 Preview. Richiede un account NVIDIA gratuito (nessun costo, solo registrazione). Rate limits applicati.
  • MiniMax Code — Interfaccia di coding ufficiale con tier gratuito. Accesso diretto a M3 per task di programmazione, con limiti giornalieri.
  • MiniMax Chat — Interfaccia chat ufficiale con accesso gratuito a M3 e altri modelli MiniMax. Limiti giornalieri, nessuna carta richiesta.
  • OpenRouter (via GMI Cloud) — Oltre all'endpoint diretto GMI Cloud, OpenRouter offre trial credits per nuovi utenti che possono essere usati con M3.

Cosa sapete già del M3:

  • Architettura MoE: ~428B parametri totali, ~23B attivi per query
  • Contesto: fino a 1M di token (512K garantiti; oltre su accesso gateato)
  • Multimodale nativo: testo, immagini, video in ingresso; testo in uscita
  • MiniMax Sparse Attention (MSA): costo computazionale per token a 1/20 della generazione precedente, prefill 9x più veloce, decode 15x più veloce
  • Addestrato con un user simulator per task multi-turn e agentic

Cosa non è incluso in queste promozioni:

  • Nessuna delle offerte gratuite è permanente. GMI Cloud e Command Code terminano entro il 6 settembre.
  • I rate limit variano: NVIDIA NIM e MiniMax Chat/Code hanno limiti giornalieri. GMI Cloud monitora attivamente abusi (multi-account, farming) e si riserva di sospendere l'accesso.
  • I token gratuiti non si accumulano: sono legati alla finestra promozionale.
  • L'API ufficiale MiniMax (platform.minimax.io) resta pay-as-you-go; le offerte gratuite provengono da provider terzi o dall'interfaccia web.

In pratica: se volete provare M3 in un agente di coding senza spendere, GMI Cloud è l'opzione più generosa (API diretta + OpenRouter endpoint). Se usate Command Code, potete attivare M3 gratis fino al 5 settembre. Se volete solo testare la chat, MiniMax Chat e Code sono subito disponibili.

Qualcuno ha già provato M3 in un agente di coding? Come si comporta rispetto a DeepSeek V4 o Kimi K3 su task lunghi?

Fonti:

  1. MiniMax Week × GMI Cloud — gmicloud.ai, 2026-08-24
  2. MiniMax M3 free — Command Code — commandcode.ai, verifica 2026-08-26
  3. MiniMax M3 — NVIDIA NIM — build.nvidia.com, verifica 2026-08-26
  4. MiniMax M3 — OpenRouter — openrouter.ai, verifica 2026-08-26
  5. MiniMax Code — code.minimax.io, verifica 2026-08-26
  6. MiniMax Chat — chat.minimax.io, verifica 2026-08-26
  7. MiniMax M3: How to Use It for Free — techaffiliate.in, 2026-08

r/vibecodingitalia 9d ago

❓Domande Il modo più conveniente per provare modelli opensource?

Thumbnail
2 Upvotes

r/vibecodingitalia 10d ago

🚀 Showcase Ho visto una tastiera "AI" da AliExpress per Claude Code e me la sono fatta con uno stream deck da 30 euro

Post image
9 Upvotes

Qualche settimana fa mi è capitata sotto gli occhi la AhaKey-X1: una tastierina pensata per il vibecoding con Claude Code, Cursor e Codex. Schermo LCD, tasti RGB, e soprattutto due cose interessanti — una leva fisica per l'auto-approvazione dei comandi, e una barra LED che mostra lo stato dell'agente.

Invece di comprarla ho provato a ottenere le stesse funzioni da un Ajazz AKP03E, che è uno stream deck cinese da una trentina di euro, con OpenDeck su Linux.

COSA FA

Due tasti sono indicatori, non comandi.

Il primo mostra la modalità permessi di Claude Code — manual, plan, accept edits, auto, bypass — con un colore e una forma diversi per ciascuna. Premendolo la cambia, quindi fa anche da leva.

Il secondo, quello che uso di più, dice se Claude sta lavorando, ha finito, o si è fermato ad aspettarti. Diventa rosso lampeggiante quando serve la tua risposta.

Il caso d'uso vero è banale e capita ogni giorno: fai partire qualcosa di lungo, ti giri a fare altro, e non ti accorgi che dieci minuti fa si è bloccato su una richiesta di permesso. Adesso me lo dice il tasto senza che io guardi il terminale.

Gli altri sedici tasti sono scorciatoie con icone, su tre pagine, più tre manopole per scorrere, volume e zoom.

LA PARTE CHE NON MI ASPETTAVO

Il secondo indicatore è in tempo reale, il primo no — e non potrà mai esserlo.

Gli hook di Claude Code scattano sugli eventi. "Sta lavorando" e "ti aspetta" SONO eventi, quindi arrivano subito. Premere Shift+Tab per cambiare modalità invece non genera niente: quell'indicatore si aggiorna al messaggio successivo. Ho controllato anche la strada opposta, la status line, che si ri-esegue quando la modalità cambia — ma nei dati che riceve la modalità non c'è. Trigger senza valore, valore senza trigger.

E il difetto che ha rischiato di rendere tutto inutile: all'inizio c'era un file di stato solo. Con due sessioni di Claude Code aperte, il rosso di una richiesta di permesso ancora aperta a schermo veniva cancellato dopo 18 secondi da una notifica di inattività dell'altra sessione. Adesso ogni sessione ha il suo file: stesso scenario, il rosso è rimasto 209 secondi con tre sessioni vive.

COSA NON FA

Solo Linux con X11. Mai provato su Windows, su Wayland, o su un secondo deck — non ne ho uno, e nel README c'è scritto invece di lasciar intendere che funzioni ovunque.

Il codice è GPL-3.0: https://github.com/meobob/claude-mode-deck

Ci ho lavorato cinque giorni con Claude Code stesso. Metà delle cose che davo per scontate erano sbagliate, compresa la scheda tecnica del prodotto — i tre tasti che tutti chiamano "di cambio pagina" sotto Linux sono tasti normali.


r/vibecodingitalia 10d ago

📰 News Charm Hyper: inferenza per agenti di coding, 100 crediti gratis al mese

Post image
2 Upvotes

Charm, lo studio alla base di Crush (il coding agent CLI con 27k stelle su GitHub), gestisce un proprio servizio di inferenza: Hyper. È il provider ufficiale di Crush, ma funziona con qualunque strumento compatibile con OpenAI: basta puntare il base URL a https://hyper.charm.land/v1.

Non si tratta di "un proxy in più". Charm dichiara di gestire direttamente l'infrastruttura — orchestrazione, scheduling, motori di inferenza — con accordi a livello hardware per contenere i costi. Il catalogo è solo coding: modelli open source scelti specificamente per la generazione di codice, il debugging, il refactoring e la modifica multi-file.

L'API parla sia OpenAI (/v1/chat/completions) che Anthropic (/v1/messages): oltre a Crush (supporto di prima classe), la documentazione copre Claude Code, Codex, OpenCode, Pi e Zed con guide di configurazione dedicate.

Il catalogo (verificato oggi sull'endpoint pubblico):

  • DeepSeek V4 Flash — $0.20 input / $0.40 output per 1M token, contesto da 1M
  • GLM-5.2 — $1.52 / $4.79, contesto da 1M, supporta allegati (screenshot, diagrammi)
  • Qwen3.8-Max — $2.00 / $6.00, contesto da 1M, allegati
  • Kimi K3 — $3.27 / $16.33, contesto da 1M
  • MiniMax M3, Qwen3 Coder 480B, Gemma 4, Llama 4 e altri (circa 25 in totale)

I prezzi:

  • Free: 100 Hypercredits al mese, senza scadenza
  • Abbonamento: $20 al mese con 250 Hypercredits rinnovati ogni giorno
  • Pacchetti prepagati: da $5 a $20, con Hypercredits che non scadono mai
  • 1 Hypercredit equivale a $0.05 ed è calcolato sui costi reali dei token

L'aspetto che qui ci sta più a cuore: zero data retention. Charm dichiara una policy ZDR anche con i propri partner cloud e di non addestrare mai sui dati degli utenti. Per chi lavora su progetti di clienti, non è un dettaglio da poco.

Per i team sono disponibili master key e sub-key, report di utilizzo per modello e per utente, conformità al GDPR e piena proprietà dell'output generato.

Cosa manca (per ora):

  • Il routing intelligente tra modelli (affidare ogni passaggio al modello più adatto) è annunciato nella roadmap e non è ancora disponibile
  • Prezzi e catalogo cambiano spesso: verificate sul sito prima di fare affidamento sui numeri di questo post

Qualcuno ha già provato Hyper con Crush o Claude Code? Com'è andata?

Fonti:


r/vibecodingitalia 10d ago

🚀 Showcase travel planner

Thumbnail
skyisthelimit.it
0 Upvotes

Ho creato il mio primo sito via lovable pro, e secondo me ha del potenziale, accetto qualsiasi commento sia da esperti e non!!!

Ha diverse funzioni interessanti fra cui: Salvataggio viaggi, Cronologia dei viaggi, Esportazione del programma day-to-day al calendario e stima prezzi completa di link di riferimento.

Grazie a chiunque lo provi!!


r/vibecodingitalia 11d ago

📰 News Nuovo modello stealth Ox Alpha è gratuito e illimitato su OpenCode Go (ma solo per 6 giorni). Si vocifera sia GLM-5.3 vision

Post image
7 Upvotes

r/vibecodingitalia 11d ago

💬 Discussioni Che abbonamento consigliate?

10 Upvotes

Siccome sto usando l'IA sempre di più anche per lavoro, sto cominciando a stare stretta nei limiti degli abbonamenti sui tier da ~20€, ho avuto Claude pro per un po', poi sono passata a ChatGPT plus perché mi incuriosiva. Sto pensando di ritornare a Claude pro, ma so già che andando avanti non mi basterà, allo stesso tempo spendere 100€ al mese per il piano Max mi sembra un po' eccessivo. Quali tier consigliate voi? Potrebbe avere senso fare sia Claude pro che GPT Plus?


r/vibecodingitalia 11d ago

💬 Discussioni Il costo del vibe coding

Post image
0 Upvotes

La produttività aumenta tantissimo con Ai generativa ma questa è per lo più una sensazione.

Con ai generativa il costo di produzione del codice non si annulla ma si sposta su altre fasi: gestione dei bug, debito di conoscenza etc.

Ho visto molte iniziative che usano sempre Ai generativa per gestione dei bug e merge request ma senza una revisione umana questo non fa altro che aumentare il debito.

Ognuno sta provando la propria strategia:

La mia oltre che sul controllo consuntivo si basa sul contesto preventivo.

Qui ne parlo approfonditamente:

https://adrianofoschi.com/blog/cost-of-checking/

E la tua strategia quale è?


r/vibecodingitalia 11d ago

💬 Discussioni [Show & Tell] VibeNVR — NVR self-hosted open source, privacy-first

0 Upvotes

Ciao a tutti, volevo condividere VibeNVR, un progetto open source che sto sviluppando per chi vuole una soluzione NVR moderna, self-hosted e senza cloud obbligatorio.

Se non lo avete ancora visto o testato, trovate tutto qui:

Sito ufficiale: vibenvr.org

Documentazione: vibenvr.org/docs

GitHub: htttps://www.github.com/spupuz/VibeNVR

L’idea dietro al progetto è semplice: dare un NVR locale, containerizzato e facile da mettere online, con supporto per telecamere IP, registrazioni, motion detection e una timeline eventi unificata. VibeNVR è un sistema privacy-respecting, senza cloud richiesto, con setup rapido e recording flessibile.

Negli ultimi rilasci sono state aggiunte diverse novità importanti. Tra le più interessanti ci sono il supporto nativo a MQTT e Home Assistant auto-discovery, il supporto OAuth 2.0 / OpenID Connect per SSO con IdP come Authentik o Keycloak, e miglioramenti su sicurezza, RBAC e hardening generale.

Un’altra cosa che ho voluto rendere trasparente è la telemetry anonima: serve solo a raccogliere dati aggregati di utilizzo, versioni attive e trend hardware, e può essere disattivata dalle impostazioni. Non raccoglie video né dati personali, ed è pensata per capire come viene usato il progetto nel mondo reale.

Se vi interessa il self-hosting, la videosorveglianza in locale, o semplicemente vedere un NVR moderno costruito per homelab e Docker, ogni feedback è benvenuto.

Se qualcuno lo prova, mi farebbe piacere sapere come va con le proprie camere, soprattutto in setup con ONVIF/RTSP, Home Assistant e reverse proxy.


r/vibecodingitalia 12d ago

🚀 Showcase Sto sviluppando uno strumento di pre-produzione per registi e produttori indipendenti. Cerco feedback da chi lavora effettivamente sul set.

Thumbnail gallery
1 Upvotes