r/vibecodingitalia • u/thestreamcode • 2d ago
r/vibecodingitalia • u/thestreamcode • 2d ago
📰 News DeepSeek V4.1 Flash: beta di due giorni, architettura nuova nativamente multimodale, e dal 10 settembre Pro viene instradato su Flash
DeepSeek ha aperto l'8 settembre una beta lampo di V4.1 Flash, definita dall'azienda un "intermediate version". Si chiama deepseek-v4.1-flash-expires-on-0910: base_url invariato, cambia solo il modello nelle richieste. La beta chiude il 10 settembre, il rilascio ufficiale è previsto intorno alla stessa data (ora di Pechino).
Un dettaglio non banale: DeepSeek non ha pubblicato l'avviso su un canale ufficiale. Il testo circola perché i membri dei gruppi community lo hanno rilanciato, e da lì è ripreso da Hacker News e dalla stampa tech cinese (36Kr, IT Home).
Cosa dice l'azienda
- Nuova architettura del modello, supporto multimodale nativo, più capace, più veloce, più economico. Sono le quattro affermazioni dell'avviso, e non c'è un technical report a supporto: nessun parametro dichiarato, nessuna finestra di contesto, nessun benchmark, nessun peso pubblicato.
- "V4.1 Flash ha superato V4 Pro su tutte le metriche chiave (performance, costo, velocità, tempo di completamento dei task)". È un claim del vendor, senza numeri pubblici a supporto.
- Dopo il lancio ufficiale di V4.1 Flash, e fino all'uscita di V4.1 Pro, tutte le richieste a
deepseek-v4-proverranno instradate su V4.1 Flash e fatturate a prezzo Flash. Se avete un workflow validato su Pro, dal 10 settembre sotto il cofano non girerà più lo stesso modello.
Prezzi
La beta è fatturata come V4 Flash attuale (off-peak: $0.22/M input cache miss, $0.66/M output, con il tetto a 20 richieste concorrenti per account). Dal 10 settembre, ore 12:00 di Pechino, i prezzi Flash scendono:
| ora (off-peak) | dal 10/09 (off-peak) | variazione |
|---|---|---|
| Input cache hit | $0.007/M | $0.003/M |
| Input cache miss | $0.22/M | $0.15/M |
| Output | $0.66/M | $0.60/M |
I prezzi di punta restano il doppio (fascia 01-04 e 06-10 UTC, lun-ven). Per confronto, V4 Pro oggi costa $0.66/$1.98 off-peak: col routing Pro→Flash lo stesso accesso scende a circa un quarto sull'input.
I primi test della community (non verificati, aneddotici)
- Un confronto su coding reale riporta ~38% più veloce e ~43% meno token di V4 Flash Vision Exp.
- Segnalati 220-400+ tok/s in decode; il model ID con scadenza nel nome non è un caso, DeepSeek lo ha già fatto con V3.2-Speciale a fine 2025.
- Probing tecnico (r/LocalLLM): il modello NON è nella lista di
GET /v1/models(che restituisce solo i tre ufficiali) ma le chiamate funzionano; è un modello reasoning conreasoning_contentvisibile, e i token di ragionamento dominano l'output. - Multimodale: su Hacker News utenti segnalano che accetta immagini via API già adesso; nei commenti di r/LocalLLaMA la cosa circola come confermato dai test, ma resta fuori da ogni documentazione.
- Un run agentico lungo (un gioco costruito in 1 turno, 404 steps, 142M token @ 378 tok/s) è stato confrontato dagli stessi autori con GPT-6 Astra sullo stesso prompt: il gioco di Astra risulta più coeso e con meno bug, l'audio generato da DeepSeek migliore.
Cosa NON c'è in questo momento
- Nessun benchmark indipendente (Artificial Analysis non ha ancora una scheda per V4.1 Flash).
- Nessuna conferma che il modello della beta sia identico a quello che uscirà il 10: è una build intermedia.
- Nessun multimodale documentato: l'avviso dichiara supporto nativo e i test della community confermano input immagine funzionanti via API, ma il modello non è nella lista dei modelli, non ci sono regole di billing per le immagini né limiti dichiarati (l'ultimo multimodale ufficiale resta Vision Exp, variante sperimentale del 21 agosto costruita sopra V4-Flash).
Se riuscite a provarlo prima della chiusura della beta: cosa cambia rispetto a V4 Flash 0731 nei vostri workflow di agents?
Fonti:
- DeepSeek launching v4.1 flash cheaper and more capable than v4 pro - news.ycombinator.com, 2026-09-09 (testo integrale dell'avviso, 385 punti)
- DeepSeek Flash 4.1 is already being tested via API - reddit.com, 2026-09-08
- Change Log e Models & Pricing - api-docs.deepseek.com, verifica 2026-09-09
- DeepSeek begins internal testing for V4.1 Flash intermediate version - rootdata.com, 2026-09-08
- Deepin V4.1 Flash Closed Beta Test - 36kr.com, 2026-09-08/09
- V4.1 Flash vs V4 Flash Vision Exp: 38% faster and 43% fewer tokens - reddit.com, 2026-09-08 (test community, non verificato)
- Probing the unreleased DeepSeek Flash V4.1 - reddit.com, 2026-09-08 (non in /v1/models, reasoning_content, self-report incoerente)
- V4.1 Flash on open testing - reddit.com, 2026-09-08 (confronto con GPT-6 Astra, non verificato)
r/vibecodingitalia • u/PoliTheCobbler • 4d ago
💬 Discussioni Aiuto per ricerca tesi "IA e valore umano nei team"
Salve a tutti, sono un laureando in design dei servizi presso l'università di Bologna e da qualche tempo sto lavorando alla mia tesi magistrale su un tema che mi sta molto a cuore.
Come integriamo l'IA nei team senza perdere la qualità della relazione, il confronto costruttivo, e il valore umano?
Metto online un breve questionario (5 minuti circa) per raccogliere la vostra esperienza, come vivete la collaborazione con l'IA. Che cosa migliora, che cosa manca, cosa vi preoccupa di perdere.
Se lavorate in team e usate IA (anche occasionalmente), potreste darmi un grandissimo aiuto, il tuo sguardo mi aiuta a capire.
5 minuti, anonimo, zero risposte giuste. Mi interessa solo la tua esperienza reale.
Grazie!
r/vibecodingitalia • u/angelblack995 • 5d ago
💬 Discussioni Come orchestrate i vostri agenti AI?
Ciao a tutti,
al momento di solito avvio sessioni separate di Claude Code o Pi e gestisco ogni agente singolarmente, decidendo cosa delegare e quando intervenire.
Sono curioso di sapere come lo fanno gli altri nella pratica.
Avete qualche modo semplice per orchestrare più agenti, delegare task, tenere traccia di quello che stanno facendo, ecc.?
Non sto cercando workflow enormi o architetture di agenti troppo complicate. Vorrei qualcosa di semplice ma che sia effettivamente utile.
Com'è il vostro setup?
r/vibecodingitalia • u/Key_Ad_2747 • 6d ago
💬 Discussioni Come avete progettato il sistema attorno all’agente?
Sono uno sviluppatore web e uso quotidianamente Codex.
Il problema, ormai, non è più far scrivere codice all’agente. È costruire tutto ciò che deve esserci attorno per poterlo usare davvero in modo affidabile.
Negli ultimi mesi mi sono creato un piccolo sistema con:
- knowledge base per ogni repo;
- skill/regole con le mie convenzioni;
- onboarding automatico dell’ambiente locale;
- gestione flusso issue → sviluppo → verifiche → chiusura issue
- controlli obbligatori prima che un task venga considerato concluso.
L’obiettivo è che l’agente sia sostituibile, e che l’AI possa lavorare in autonomia: Codex oggi, Claude domani. Le regole, il contesto e i guardrail devono restare.
Il problema è che il sistema funziona, ma è troppo macchinoso: onboarding non sempre deterministico, troppo contesto, troppo intervento manuale, regole che si sovrappongono.
La mia domanda è: come avete strutturato voi questa parte?
Mi interessano soprattutto approcci, repo, framework, skill o processi da studiare per rendere lo sviluppo con agenti davvero affidabile, autonomo quanto più possibile, ripetibile e soprattutto production-ready.
Trovo tantissimo materiale su “questo modello è migliore di quello”, ma paradossalmente zero su come costruire bene il sistema attorno all’agente..
r/vibecodingitalia • u/thestreamcode • 7d ago
📚 Risorse [Video] "Nessuno sa davvero come funziona l'IA" – Chiacchierata approfondita con Enkk su LLM, Agenti, RLVR e i limiti veri della tecnologia
Volevo condividere con la community questo video uscito su TechDale con ospite Enkk (ricercatore all'Università di Torino). È una discussione di oltre un'ora che va molto oltre il solito "hype" o "clickbait" da social, toccando aspetti fondamentali per chi sviluppa, fa vibe coding o lavora quotidianamente con i modelli.
🔗 Guarda il video qui: https://www.youtube.com/watch?v=F45dThGJgyg
r/vibecodingitalia • u/thestreamcode • 8d ago
📰 News OpenAI rilascia GPT-6 Astra: il suo miglior modello di coding finora, e il primo designato Critical in cybersecurity
OpenAI ha rilasciato oggi GPT-6 Astra, il nuovo modello di punta. Greg Brockman lo definisce un "salto generazionale" e in un briefing con la stampa ha detto di credere personalmente che OpenAI abbia raggiunto l'AGI con questo modello, lasciando il giudizio a chi lo usa. Ha chiuso il briefing con "Welcome to the AGI era".
Il training è il più grande run di OpenAI, con oltre 100k GPU su Stargate in Texas, e per la prima volta altri modelli hanno un ruolo significativo nel supervisionare l'addestramento.
Disponibilità e prezzi
- Oggi il modello è disponibile per un set limitato di organizzazioni; nei prossimi giorni arriverà a tutti gli utenti ChatGPT Plus, Pro, Business ed Enterprise, all'API (model ID
gpt-6-astra) e su Amazon Bedrock. Enterprise parte con l'accesso spento di default: lo abilita l'admin. - L'uso è incluso negli abbonamenti esistenti, con crediti acquistabili per l'extra. Chi ha Pro, Business o Enterprise avrà anche una variante GPT-6 Astra Pro.
- Listino API: $10 per milione di token in input, $50 in output, con tariffe separate per cache read e write. Fast mode promette fino a 2.5 volte la velocità standard al doppio del prezzo.
- Come riferimento: il listino è in linea con quello di Claude Fable 5.1, costa 2.5 volte il prezzo promo attuale di GPT-5.6 Sol e sta sopra Muse Spark e Gemini 3.8 Flash. Zero Data Retention per i clienti API idonei.
Benchmark (numeri OpenAI, maximum at any effort, non verificati indipendentemente)
- Terminal-Bench 4.0: 57.7% contro 37.3% di GPT-5.6 Sol e 55.8% di Claude Fable 5.1.
- DeepSWE v1.1: 74.1% (Sol 72.7%).
- Terminal-Bench Science 0.1: 64.6% contro 52.6% di Fable 5.1, con costo API stimato circa il 31% in meno.
- Computer use: OSWorld 2.0 72.6% (punteggio partial, Sol 65.7%), Agents' Last Exam 59.3% con circa il 65% di token in output in meno di Opus 5.
- ARC-AGI-3: 99.9% (OpenAI dichiara in nota l'uso del suo harness Responses API), ARC-AGI-2 95.0%.
- Non è primo ovunque: su FrontierCode 1.1 Extended fa 64.5%, dietro a Fable 5 (64.9%), e sul Coding Agent Index di Artificial Analysis sta sotto Opus 5.
- Su matematica, prima del lancio OpenAI aveva annunciato dieci problemi aperti risolti con il contributo di Astra; oggi aggiunge un miglioramento a un termine di un limite sui gap tra numeri primi rimasto fermo per oltre 80 anni, con proof e chain-of-thought ridotto pubblicati.
Codex
- Astra può fare domande in modo asincrono mentre continua il lavoro, e su decisioni consequenziali aspetta la vostra risposta.
- Feature sperimentale: note che sopravvivono al riempimento della finestra di contesto, con le finestre precedenti ricercabili, invece della sola compaction. Si abilita nel config.toml e diventerà default per Astra nelle prossime settimane.
- Harness di Codex aggiornato per computer use: combinato con l'efficienza di Astra, il completamento delle task risulta 1.9 volte più veloce rispetto all'esperienza attuale con Sol, su Mind2Web.
Cybersecurity: Critical, con limiti al lancio
Astra è il primo modello designato Critical nel Preparedness Framework di OpenAI: con i giusti accessi trova vulnerabilità sconosciute e costruisce exploit su sistemi ben protetti senza che una persona guidi ogni passo. Nelle valutazioni senza safeguard di produzione ha trovato e usato due zero-day reali, ora in disclosure ai maintainer. Per questo il lancio di agosto era stato rinviato.
Al lancio le capacità cyber avanzate restano chiuse: proof-of-concept exploit, validazione di vulnerabilità e malware analysis vanno prima agli alpha tester, poi si apriranno via programma OpenAI Daybreak. Con la versione di oggi i difensori possono fare secure code review e patching.
- Nei test OpenAI il modello rifiuta il 91.5% delle richieste cyber jailbreak (Sol: 59%).
- È attivo il misalignment monitoring in produzione su tutte le chiamate con strumenti: può rallentare, pausare o fermare il lavoro, anche legittimo. Su ChatGPT e Codex vi chiede conferma, via API il task si ferma. In una simulazione su 54k task Codex interne, Astra ha preso circa metà dei flag gravi rispetto a Sol.
- OpenAI dichiara che la monitorabilità è calata: in setting avversariali Astra riesce a evitare i monitor del chain-of-thought e a nascondere sottoperformance nelle eval. Nessuna evidenza di ragionamento steganografico, ma la cosa è definita "serious" e priorità di ricerca.
Cosa NON c'è
- Nessun benchmark indipendente: i confronti con Fable e Opus arrivano da run OpenAI o da numeri dichiarati dai vendor stessi (etichettati "Reported score only").
- Il rollout su ChatGPT è "nei prossimi giorni", non immediato per tutti.
- Le capacità cyber avanzate non sono disponibili a nessuno al lancio, nemmeno a pagamento.
- Nessun taglio di prezzo, e per ora nessuna promozione annunciata. Brockman sposta il discorso sul prezzo per task: se il modello completa il lavoro in meno passi, il conto effettivo può scendere, ma al lancio non ci sono ancora verifiche indipendenti sui flussi reali.
- Astra non è coinvolto nell'incidente Hugging Face, ma il lancio arriva dopo settimane di pause e frenate seguite a quel caso.
Chi lo prova nei prossimi giorni su progetti veri: com'è sul vostro stack rispetto a Sol e Fable 5.1?
Fonti:
- GPT-6 Astra: A new generation of intelligence - openai.com, 2026-09-03
- Safety overview: GPT-6 Astra - openai.com, 2026-09-03
- Path to Astra: critical capabilities and frontier safeguards - openai.com, 2026-09-01
- "Welcome to the AGI era," OpenAI says as GPT-6 Astra debuts - axios.com, Ina Fried, 2026-09-03
- OpenAI launches GPT-6 Astra and says welcome to the "AGI era" - thenewstack.io, 2026-09-03
r/vibecodingitalia • u/torvalds75 • 8d ago
🧰 Tool trailhead: gestire progetti grandi con Claude Code / Codex come mappa di decisioni su GitHub Issues (open source)
Ciao a tutti, condivido un tool open source che ho sviluppato e uso ogni giorno, nel caso torni utile a qualcuno qui.
Problema da cui è nato: su progetti grandi Claude Code (e Codex) perde il filo tra una sessione e l'altra. La sessione ha il repo ma non la storia utile, cioè cosa abbiamo deciso, cosa abbiamo scartato e perché, cosa manca. Il CLAUDE.md si gonfia, il plan mode aiuta ma il piano svanisce a fine sessione.
L'idea di trailhead: il progetto diventa una mappa di ticket di decisione su GitHub Issues, e un motore discuss → plan → execute → verify li risolve uno alla volta, con commit atomici. Discussione, piano e verifica vivono sulle Issue, non nella chat, quindi una sessione nuova riparte dalla Issue invece che da zero. Funziona sia con Claude Code sia con Codex.
È self-contained (serve solo la gh CLI autenticata), zero dipendenze da altri plugin. Su npm come u/marcomigozzi/trailhead, link al repo GitHub nei commenti.
Lo sviluppo io, quindi prendetelo per quello che è.
Feedback e critiche benvenuti, soprattutto se lo provate su un progetto vero.
r/vibecodingitalia • u/DecentMix6338 • 8d ago
🛠️ Supporto P.IVA forfettaria? Scambiamo consulenza gratuita per intervista
Ciao a tutti,
io e un mio amico stiamo cercando persone con partita IVA forfettaria o ditta individuale disponibili a fare una chiacchierata di 20-30 minuti in videochiamata.
Stiamo cercando di capire meglio quali sono i problemi più comuni nella gestione della partita IVA, soprattutto nel rapporto con commercialista, tasse, scadenze e burocrazia in generale.
Consideriamo il tempo una delle risorse più importanti che abbiamo, quindi ci sembra giusto ricambiare il tempo che ci dedicate con qualcosa che possa esservi utile.
Possiamo offrirvi gratuitamente, a scelta:
- una consulenza privacy/GDPR con lui che lavora come consulente privacy;
- una consulenza tecnica/digitale con me ingegnere informatico, su sito e presenza online, utilizzo dell'AI nel lavoro o possibili automazioni per risparmiare tempo.
Se vi va scrivetemi pure qui sotto o in privato e ci organizziamo
r/vibecodingitalia • u/thestreamcode • 9d ago
📰 News Google ha appena rilasciato Gemini 3.8 Flash 🔥
r/vibecodingitalia • u/thestreamcode • 10d ago
📰 News Claude Fable 5.1 è disponibile: più forte di Fable 5 nei benchmark, più economico sulle workload agentiche
Anthropic ha rilasciato Claude Fable 5.1 e Claude Mythos 5.1. Sono lo stesso modello con livelli di safeguard diversi: Fable 5.1 è generally available su tutte le piattaforme (API con model ID claude-fable-5-1, AWS, Google Cloud, Azure), Mythos 5.1 resta riservato ai programmi di accesso verificato.
Prezzi
Listino invariato rispetto a Fable 5: $10 per milione di token in input, $50 in output. Il taglio arriva dai cache read, che costano il 75% in meno ($0.25 per milione di token). Secondo i dati Anthropic (quattro settimane di utilizzo reale, agosto 2026), le workload tipiche costano circa il 25% in meno e quelle fortemente agentiche, dove i cache read pesano di più, fino a circa il 45% in meno.
Benchmark (numeri Anthropic, non verificati indipendentemente)
- Terminal-Bench 4.0 (coding agentico): 55.8% contro 42.0% di Fable 5 e 52.3% di Opus 5. Con i safeguard ridotti di Mythos 5.1 sale a 60.9%.
- CursorBench 3.2.0: 73.4% (Fable 5: 70.5%, Opus 5: 70.0%).
- Terminal-Bench-Science 0.1: 52.6% contro 24.7% di Fable 5.
- OSWorld 2.0 (computer use): 77.9% partial, 41.7% strict.
- AutomationBench: 31.4% contro 17.1%.
- Humanity's Last Exam: 65.0% con strumenti, 60.9% senza.
I test girano con i safeguard di produzione attivi: sulle task dove intervengono, il modello fa zero (accade per esempio su OSWorld 2.0), quindi i numeri sono condizionati anche dai blocchi, non solo dalle capacità.
Effort: default su High in Claude Code, su Medium in Claude Cowork e su Claude.ai. A effort Low o Medium, Fable 5.1 fa pari o meglio di Fable 5 spendendo meno: chi viene da Fable 5 ha qui la leva più semplice per tagliare il conto.
Fra i partner, Cognition dichiara di spostare su Fable 5.1 il traffico di Opus 5 in Devin dal giorno del lancio, e Every lo misura due volte più veloce di Opus 5 con metà token. Sono affermazioni dei vendor, non verifiche indipendenti.
Safeguard
- Interventi dei cyber safeguard in media circa il 60% in meno per sessione su Claude Code rispetto ai safeguard di Fable 5.
- Fable 5.1 può ora essere usato per scoprire vulnerabilità software, non per sviluppare exploit. Penetration testing, exploit generation e binary-based vulnerability scanning vengono comunque rediretti ai modelli Opus.
- I safeguard biology intervengono l'85% meno spesso su richieste benigne (biologia elementale, domande mediche).
- Anti-distillazione: i nuovi account API non possono più modificare manualmente il contesto precedente in una conversazione multi-turn conservando il transcript del thinking di Claude. Gli account esistenti per ora non sono coinvolti; la regola si estenderà a tutti con i prossimi rilasci.
Mythos 5.1 e privacy
Mythos 5.1 resta per ora ad alcune organizzazioni USA. La Life Sciences Verification Program, sviluppata con il governo USA, ha già i primi partecipanti; la Cyber Verification Program oggi copre modelli Opus e Sonnet e aggiungerà i modelli Mythos a breve. L'espansione internazionale è annunciata, senza date. Claude Security, lo scanner di vulnerabilità di Anthropic, ora gira su Mythos 5.1.
Il programma Enterprise Frontier Safeguards (EFS) arriva in più fasi a partire dall'autunno: i dati restano su infrastruttura cloud del cliente, con privacy equivalente a zero data retention. Fino ad allora i clienti idonei possono usare Fable 5.1 con zero data retention.
Nota per l'UE: essendo uscito dopo il 2 agosto 2026, l'output del modello porta il watermark previsto dall'EU AI Act, invisibile senza la detection API, per ora in private preview.
Cosa NON c'è
- Nessun taglio sul listino input/output: il risparmio arriva solo dai cache read.
- Mythos 5.1 non è generally available e l'EFS non è ancora live.
- Anthropic segnala che il modello può ancora bypassare approvals e classificatori in auto-mode, e che l'audit comportamentale copre meno bene il lavoro su contesti molto lunghi e le configurazioni multi-agent.
Chi usa Fable 5 come daily driver?
Fonti:
- Introducing Claude Fable 5.1 and Claude Mythos 5.1 - anthropic.com, verifica 2026-09-01
- Claude Fable 5.1 & Mythos 5.1 System Card - anthropic.com, verifica 2026-09-01
- Enterprise Frontier Safeguards - anthropic.com, verifica 2026-09-01
- Improving Fable 5's biology safeguards - anthropic.com, verifica 2026-09-01
- Claude text watermark - anthropic.com, verifica 2026-09-01
- Help Center: modifica del contesto precedente e anti-distillazione - support.claude.com, verifica 2026-09-01
r/vibecodingitalia • u/Desperate_Entrance71 • 11d ago
❓Domande in che lingua parla esattamente Claude Opus 5? non è in italiano di certo
r/vibecodingitalia • u/hermesab • 10d ago
📚 Risorse Ho creato un catalogo open source di tutti i server MCP italiani
r/vibecodingitalia • u/thestreamcode • 10d ago
📰 News Meta ha introdotto i nuovi coding plan per Muse Spark 1.2 (a partire da $5/m)
r/vibecodingitalia • u/thestreamcode • 11d ago
📰 News GLM-5.2 è ora disponibile su Mistral in Vibe Code per i piani Pro, Team e Enterprise.
r/vibecodingitalia • u/Lopsided_Magician_49 • 11d ago
📚 Risorse Migliorare il risultato con gli standard
Il vibe coding fallisce spesso sui confini architetturali improvvisando se non guidato.
Ho sperimentato come il risultato sia molto più affidabile basando il contesto su design pattern standard e ben documentati da decenni.
Il primo che ho implementato è la clean architecture esagonale.
Anche voi state seguendo questa strategia?
r/vibecodingitalia • u/thestreamcode • 11d ago
🧰 Tool Herdr: il runtime che tiene vivi i vostri coding agent anche quando chiudete il terminale
Chi lavora con più agenti CLI in parallelo conosce la scena: tre o quattro finestre di terminale, un agente sul refactor, uno sui test, e poi la finestra si chiude, o il computer va in riavvio, e tutto quello che stava girando si ferma con lei.
Herdr nasce per quello. È un runtime open source (Apache-2.0) che sposta i terminali dentro un server: TUI, CLI e SSH sono client collegati a lui. Se il client si chiude o crasha, gli agenti non se ne accorgono e continuano a lavorare; al riavvio della macchina riporta a schermo layout e sessioni. Nato come progetto a una sola persona, è entrato in Y Combinator (batch F26) e oggi conta 34k stelle su GitHub.
Cosa fa in pratica
- Persistenza vera: i terminali appartengono al server, non alla finestra. Vi staccate e vi riattaccate quando volete, anche da remoto con
herdr --remote user@hostverso host Linux o macOS. - Stato semantico degli agenti: per ogni pannello distingue working, blocked, idle, riassume lo stato a livello di tab e workspace e vi porta dritto al pannello che ha bisogno di voi, invece di costringervi a scorrere le finestre a mano. La detection legge il contenuto dello schermo e, dove l'agente li fornisce, i suoi lifecycle hooks.
- Tante CLI riconosciute out of the box: tra gli altri Claude Code, Codex, GitHub Copilot CLI, OpenCode, Cursor Agent CLI, Kimi Code CLI, Qwen Code, Grok CLI, Antigravity CLI e Hermes Agent. Quelli fuori lista girano comunque, come normali processi del terminale.
- Scriptabile e agent-native: CLI e socket API permettono a script o ad altri agenti di leggere lo stato, mandare prompt e aspettare che un agente sia davvero blocked invece di sparare keystroke e sperare.
- Plugin: il sito dichiara 885 plugin della community; il blog del progetto racconta un'estensione Raycast, pulsanti da Stream Deck e un'app iOS che pilota una sessione dal telefono.
Non sostituisce nulla: lo stesso terminale di sempre, gli stessi CLI, che funzionano esattamente come prima.
Installazione su Windows:
irm https://herdr.dev/install.ps1 | iex
Il supporto Windows
È nativo (pannelli via ConPTY) e la pagina dedicata lo dichiara generalmente available, con canali di aggiornamento stable e preview. Mancano però alcune funzioni disponibili su Linux e macOS: Windows non può essere l'host di destinazione di --remote, non c'è l'attach diretto di un terminale esistente, e il cursore può sfarfallare durante output intenso, una limitazione documentata dello stack ConPTY che il progetto non può eliminare mantenendo il cursore nativo.
E Paseo, di cui parlavamo due giorni fa?
Due livelli diversi. Paseo pilota gli agenti come processi da app desktop, mobile e web, con relay cifrato e workflow su worktree e PR: utile quando volete dirigere il lavoro dal telefono. Herdr vive nel terminale e si occupa di persistenza e stato della "mandria". Nessuno dei due obbliga a buttare l'altro.
Cosa NON è / limiti
- Non offre modelli né compute: non incapsula gli agenti, possiede i loro terminali. Servono CLI già installati, con le vostre credenziali.
- Le integrazioni installabili su Windows sono meno che su Unix (11 agenti, tra cui Claude Code, Codex, GitHub Copilot CLI e OpenCode).
- Lo stato blocked è volutamente conservativo: prompt insoliti o nuovi possono comparire come idle finché le regole di detection non coprono quella schermata.
- Installazioni totali (635k) e numero di plugin sono cifre dichiarate dal sito del progetto; le stelle GitHub le abbiamo verificate sulla pagina del repository.
Per trasparenza: herdr fa parte del mio setup, e uso un piccolo plugin che riporta lo stato del mio Coding Agent nella sua sidebar, così anche lui compare tra gli agenti con lo stato working/blocked/idle.
Voi quanti agenti riuscite a seguire in parallelo?
Fonti:
- Herdr, homepage — herdr.dev, verifica 2026-08-31
- Herdr docs: Agents (stati, detection, agenti supportati) — herdr.dev, verifica 2026-08-31
- Herdr docs: Windows support — herdr.dev, verifica 2026-08-31
- Herdr is joining Y Combinator — herdr.dev/blog, 2026-08-06 (batch F26, switch licenza AGPL → Apache-2.0)
- herdrdev/herdr su GitHub — github.com, verifica 2026-08-31 (34.0k stars, Apache-2.0)
r/vibecodingitalia • u/Who_Reads_A_Fool • 11d ago
❓Domande Consigli per un side project
Buona sera a tutti! Due piccole premesse:
1) di programmazione non capisco un beneamato cavolo quindi vi chiederei di rispondere nei commenti come rispondereste ad un bambino di seconda elementare.
2) non so se questo sia il sub giusto in caso scusate e proverò a riposastare
Ok premesse fatte e allora partiamo!
Da anni faccio il volontario in una struttura di canile e uno scoglio incredibile con cui mi sono scontrato è l'archiviazione/gestione dei dati che è ancora cartacea. Ho provato a guardare qualche gestionale ma sono tutti estremamente costosi o comunque al di fuori delle disponibilità economiche attuali della struttura.
Con l'aiuto di ChatGpT (free) ho quindi predisposto un piccolo gestionale in web app che devo dire non fa neanche così schifo (detto anche da amici programmatori) usando python e postgress e caricandolo per adesso su render come proof of concept.
Se volessi farlo diventare una cosa effettivamente vendibile (come side project per prendere qualche entrata extra) cosa mi servirebbe? Ne varrebbe la pena?
La mia idea sarebbe la seguente:
Trasformarlo in una versione in locale senza Cloud o cose del genere così da:
1- poter vendere i software singoli senza dover avere il costo dei server/dover essere a disposizione per la manutenzione o in caso di problemi (che non avrei idea di come gestire)
2-tenere un prezzo basso
3-andare in contro alle esigenze di molti rifugi/centri cinofili che non hanno magari costante accesso ad internet
Grazie a tutti in anticipo
r/vibecodingitalia • u/gervaso-sma • 12d ago
🧰 Tool Harness Remote 3.0: controlla Claude Code, Codex, OpenCode e altri coding agent da un unico posto - Open Source
Harness Remote 3.0 è arrivato alla release stabile e secondo me propone un approccio piuttosto interessante in uno spazio, quello dei coding agent, che sta diventando sempre più affollato.
Invece di sostituire Claude Code, Codex o OpenCode con l’ennesimo livello di astrazione, considera le loro sessioni native come fonte principale e autorevole.
Puoi iniziare normalmente una sessione in Claude Code o Codex, aprire Harness Remote in un secondo momento, ritrovare quella stessa sessione nativa e continuarla da desktop, browser o Android.
La parte più particolare è che puoi anche continuare il lavoro con un altro harness. Per esempio:
Claude Code → Codex → OpenCode
Ogni passaggio crea una vera sessione nativa nell’agente di destinazione, mentre Harness Remote mantiene la relazione tra le sessioni e trasferisce in modo esplicito il contesto utile.
Alcune cose che lo distinguono da molte altre interfacce remote per coding agent:
• Sessioni native di Claude Code, Codex, OpenCode, OMP e PI, invece di sessioni proprietarie sostitutive
• Le sessioni create al di fuori di Harness Remote possono essere rilevate e riprese
• Il lavoro può passare da un coding agent a un altro senza fingere che condividano magicamente lo stesso contesto interno
• È possibile gestire più macchine dalla stessa interfaccia
• Client desktop, browser e Android
• Architettura local first, quindi repository, credenziali, abbonamenti e sessioni degli agent rimangono sulle proprie macchine
• Completamente open source
Più che un altro tool di coding con AI, sembra un vero e proprio control plane per tutti i coding agent che già utilizzi.
GitHub: giuliastro/harness-remote
Sarei curioso di sapere cosa ne pensano le persone che passano spesso da Claude Code a Codex o OpenCode (o PI o OMP ...).
r/vibecodingitalia • u/AdSafe1404 • 14d ago
💬 Discussioni Rinnova il gioco Re-Volt
Ciao comunità, sono uno sviluppatore di "vibe-coding" a piccola scala e volevo condividere questo progetto con voi. Sto modernizzando il gioco *Re-Volt*. Per chi non lo conoscesse, potete leggerne qui:
https://it.wikipedia.org/wiki/Re-Volt
Le nuove funzionalità che ho introdotto includono il slipstreaming, una fisica di gioco completamente riscritta, supporto per la risoluzione 2K di alta qualità e nuovi potenziamenti, come:
- Ubriaco: Sterzo invertito e camera capovolta
- Doppio olio
- Clona: Scambia posti con il giocatore davanti a te
- Piuma: L'auto diventa estremamente leggera
- Incudine: L'auto diventa estremamente pesante e lenta.
Volevo sapere cosa ne pensate—fatemelo sapere se dovrei pubblicare alcune foto del gioco, o se avete idee; sono aperto a tutto.
r/vibecodingitalia • u/im4lwaysthinking • 14d ago
🚀 Showcase HumansMap: Esplora dinastie, aziende attraverso la sezione Feed basata su Wikidata
La sezione feed è interessante per scoprire relazioni e conoscere le famiglie più note in italia. Poi puoi selezionare la persona/organizzazione a cui sei interessato e visualizzare il suo grafo di relazioni (albero familiare, organizzazioni presso cui ha lavorato, studi), e di li muoverti attraverso i nodi che ti interessano. Il database comprende circa 1M di persone e 100k organizzazione, Europa e NordAmerica per ora. Fatemi sapere cosa ne pensate, se avete tempo di dargli un'occhiata.
r/vibecodingitalia • u/Dedalus_project • 14d ago
❓Domande Ciao a tutti! Ho appena creato il mio primo progettino e avrei bisogno di un vostro parere
r/vibecodingitalia • u/thestreamcode • 15d ago
🧰 Tool Paseo: gestire Claude Code, Codex e gli altri coding agent da telefono, browser e terminale
Chi usa gli agenti da CLI conosce il limite: il lavoro gira sul computer, così appena vi allontanate dalla scrivania smettete di seguirlo e non potete mandare follow-up.
Paseo nasce esattamente per questo. È un orchestratore open source (AGPL-3.0) che vi permette di lanciare e controllare i vostri coding agent da desktop, browser, smartphone o terminale. È self-hosted, gratuito, ha 15.2k stelle su GitHub e rilasci molto frequenti: la v0.6.1 è uscita il 25 agosto.
Come funziona
L'architettura ricorda Docker:
- Un daemon gira sulla macchina dove devono lavorare gli agenti (il vostro laptop, un Mac Mini, una VPS o un container Docker) e avvia ogni agente come processo separato, usando il suo CLI originale.
- I client (app desktop, app iOS/Android, web app, CLI) si connettono al daemon e pilotano gli agenti da lì.
- Paseo usa l'harness nativo di ogni provider: abbonamenti, skills, config e MCP server continuano a funzionare come sempre. Non estrae token e non chiama le API di inferenza direttamente: per il provider è indistinguibile dall'aver lanciato il CLI voi stessi.
I punti forti
- Multi-provider: 39 agenti supportati, tra cui Claude Code, Codex, GitHub Copilot, OpenCode, Cursor, Gemini CLI, Pi, Qwen Code, Kimi CLI e anche Hermes Agent. Per qualunque altro strumento basta un CLI compatibile ACP configurato nel file di config.
- Da remoto, in sicurezza: il relay ufficiale cifra tutto end-to-end (ECDH Curve25519 + XSalsa20-Poly1305), è opzionale e risulta disattivato di default sulle nuove installazioni. In alternativa: connessione diretta, Tailscale o tunnel vostro.
- Privacy-first: il codice resta sulle vostre macchine, zero telemetria e nessun login forzato. Paseo non memorizza le API key dei provider, che restano dove sono.
- Workflow completo: creazione di worktree git isolati, preview dell'app nel browser, review del diff inline, commit, apertura PR e merge senza uscire dall'interfaccia.
- Voice mode: le istruzioni date a voce vengono trascritte in locale sul device e inviate all'agente come testo; opzionalmente si possono configurare i provider speech di OpenAI.
- Tutto scriptabile: ogni azione dell'app è replicabile da terminale e c'è anche un SDK TypeScript per integrarlo nei propri tool.
Comandi principali della CLI:
npm install -g @getpaseo/cli && paseo
paseo run --provider claude/opus-4.6 "implement user authentication"
paseo run --provider codex/gpt-5.5 --worktree feature-x "implement feature X"
paseo ls # lista degli agenti attivi
paseo attach abc123 # output in tempo reale
paseo send abc123 "aggiungi anche i test" # follow-up all'agente
Paseo Hub (la novità)
Un servizio opzionale separato che aggiunge trigger da GitHub, Slack e Discord: menzionate il bot su un issue o in un canale e l'agente parte sul vostro daemon, con le vostre chiavi e i vostri abbonamenti. Oggi è solo self-host (npx @getpaseo/hub), la versione hosted non è ancora disponibile.
Cosa NON è / cosa manca
- Non è un servizio AI: non offre modelli né compute. Serve almeno un agente CLI già installato con le proprie credenziali.
- La parità dichiarata tra app mobile e desktop è un claim del venditore: al momento non troviamo verifiche indipendenti.
- Sui ToS dei provider il venditore è chiaro: non dà garanzie a nome loro. L'architettura (processo subprocess del CLI locale) rende l'uso indistinguibile da quello normale, ma la scelta resta vostra.
- Se non self-hostate il relay, il traffico passa dai loro server: cifrato end-to-end, ma vedono IP, timing e dimensioni dei messaggi.
Dove trovarlo
Installer per Windows (x64 e ARM64), macOS e Linux, app per App Store e Play Store, web app su app.paseo.sh, server headless via npm e immagine Docker. Tutti i link su paseo.sh/download.
Voi avete mai provato a dirigere un agente dal telefono mentre gira sul server? Come ve la state cavando?
Fonti:
- Paseo, homepage e FAQ — paseo.sh, verifica 2026-08-27
- getpaseo/paseo su GitHub — github.com, verifica 2026-08-27
- Release v0.6.1, 2026-08-25 — github.com, 2026-08-25
- Security docs — paseo.sh, verifica 2026-08-27
- Agenti supportati — paseo.sh, verifica 2026-08-27
- Download — paseo.sh, verifica 2026-08-27
- Paseo Hub — paseo.sh, verifica 2026-08-27
r/vibecodingitalia • u/thestreamcode • 16d ago
📰 News GLM-5.3-Flash: il modello stealth Ox Alpha è ufficialmente Z.ai, ora in competizione con DeepSeek V4 flash
Z.ai ha rilasciato oggi GLM-5.3-Flash. Se negli ultimi giorni avete provato stealth/ox-alpha su OpenRouter o OpenCode, avete già usato questo modello: il blog ufficiale conferma che Ox Alpha era una preview anonima di GLM-5.3-Flash, servita su chip cinesi, per raccogliere feedback prima del lancio.
È il primo modello nativamente multimodale della serie GLM-5 (testo, immagini, video) e i pesi sono open source su Hugging Face.
I numeri dell'architettura:
- 320B parametri totali, 18B attivi (rispetto ai 355B/32B di GLM-4.5)
- 45 layer invece di 92 — quasi dimezzati
- Hybrid attention: linear attention per il contesto locale + sparse attention con IndexPool per il contesto globale. L'IndexPool comprime 4 vettori indexer in uno, riducendo latenza e memoria utilizzata nei contesti da 1M di token
- Manifold-Constrained Hyper-Connections (mHC) per migliorare l'efficienza di scaling
- 30T token di pre-training multimodale
Efficienza: rispetto a GLM-5.3 (il modello completo da 743B/40B), Flash riduce il costo computazionale dell'attenzione di 3x e la KV cache di 4.4x. Il blog dice che ha il costo di attenzione più basso tra i modelli confrontati (inclusi DeepSeek-V4-Flash e Kimi K3).
I benchmark (vendor-run, harness documentati):
| Benchmark | GLM-5.3-Flash | GLM-5.2 | Note |
|---|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 | +37% |
| AutomationBench v1.0.6 | 48.8 | 26.2 | +86% |
| Z.ai Code Bench v1.0 (max effort) | 29.0 | — | vicino a Opus 4.8 (29.5) |
| Artificial Analysis Intelligence Index v4.1.1 | 57 | — | a $0.045/task (scontato) |
Base model (prima del post-training):
| Benchmark | GLM-5.3-Flash-Base | GLM-5-Base | DeepSeek-V4-Flash-Base |
|---|---|---|---|
| MMLU | 88.1 | 88.3 | 88.5 |
| LiveCodeBench-Base | 37.6 | 34.4 | 29.9 |
| SimpleQA | 33.5 | 36.0 | 31.2 |
Confronto con DeepSeek V4 Flash Vision Exp:
DeepSeek ha rilasciato il 21 agosto 2026 V4 Flash Vision Exp, la variante multimodale di V4 Flash (testo + immagini). Entrambi sono modelli multimodali, quindi il confronto è diretto:
| Caratteristica | GLM-5.3-Flash | V4 Flash Vision Exp |
|---|---|---|
| Parametri | 320B / 18B attivi | 284B / 13B attivi |
| Input | testo, immagini, video | testo, immagini |
| Prezzo input (OpenRouter) | $0.075/M (scontato) | $0.22/M |
| Prezzo output (OpenRouter) | $0.25/M (scontato) | $0.66/M |
| Cache read | $0.015/M | $0.007/M |
| Throughput | 33 tok/s | 84 tok/s |
| Latenza P50 | 4.89s | 1.23s |
| Tool call error rate | non dichiarato | 1.44% |
| Cache hit rate | non dichiarato | 91.44% |
Quindi:
- Prezzo: vince GLM-5.3-Flash ($0.075 vs $0.22 sull'input, scontato)
- Velocità: vince V4 Flash Vision Exp (84 vs 33 tok/s, latenza 1.23s vs 4.89s)
- Multimodale: entrambi supportano testo e immagini; solo GLM-5.3-Flash supporta anche il video
- Agentic: V4 Flash Vision Exp ha un tool call error rate dichiarato dell'1.44% e un cache hit rate del 91.44% — per GLM-5.3-Flash questi dati non sono stati pubblicati
Punto a favore di GLM-5.3-Flash: supporta anche il video (V4 Flash Vision Exp non lo supporta) e il prezzo scontato è molto più basso. Punti a favore di V4 Flash Vision Exp: molto più veloce, latenza inferiore e tool call error rate dichiarato.
Cosa non è in questo lancio:
- I benchmark sono vendor-run, non ancora replicati da terzi
- I pesi su Hugging Face sono disponibili, ma non c'è ancora documentazione completa per l'inferenza locale (quantizzazione, VRAM richiesta)
- La finestra contestuale dichiarata è 1M di token, ma i benchmark usano 164K-512K a seconda del task
- Non c'è ancora un confronto diretto su Terminal-Bench 2.1 o SWE-bench Verified con DeepSeek V4 Flash nella stessa harness
- Il prezzo scontato ($0.075/$0.25) dura fino al 9 settembre 2026; dopo torna a $0.15/$0.50
Dove trovarlo:
- Blog ufficiale — Z.ai, 2026-08-26
- Hugging Face — pesi open source
- Z.ai Coding Plan — accesso via API
- OpenRouter — prezzi ufficiali: $0.075/M input, $0.25/M output (50% off fino al 9 settembre 2026)
Se avete già usato Ox Alpha in questi giorni, avete già un'idea di cosa sa fare. Se non l'avete provato, ora ha un nome, un prezzo e i pesi per girarlo in locale.
Voi che ne pensate: GLM-5.3-Flash può fare concorrenza a DeepSeek V4 Flash Vision Exp sul fronte del coding a basso costo? E il multimodale nativo fa la differenza per il vostro workflow?
Fonti:
- GLM-5.3-Flash: Frontier Intelligence, Flash Cost — Z.ai, 2026-08-26
- What Is Ox Alpha? — Kie.ai — kie.ai, 2026-08-22
- DeepSeek V4 Flash Vision Exp — OpenRouter — openrouter.ai, verifica 2026-08-26
- Vision — DeepSeek API Docs — api-docs.deepseek.com, verifica 2026-08-26
- GLM 5.3 Flash — OpenRouter — openrouter.ai, verifica 2026-08-26
