DeepSeek V3 vs Claude Sonnet: mijn eigen benchmarks voor code
Er wordt veel gepraat over DeepSeek en hoe goed het is voor de prijs. Ik wilde het zelf testen voor code taken, dus heb ik een kleine benchmark gedaan.
Test setup: 10 programmeer-opdrachten van makkelijk tot moeilijk. Varierend van "schrijf een functie die palindromen checkt" tot "bouw een complete REST API met auth en rate limiting". Elke opdracht gegeven aan DeepSeek V3 en Claude Sonnet (3.5), zelfde prompt.
Mijn bevindingen:
- Bij simpele taken (1-5): vrijwel gelijk. Beide leveren werkende code, DeepSeek soms iets verbetiger.
- Bij medium taken (6-8): Claude wint duidelijk. Betere foutafhandeling, schonere code structuur, en het houdt beter rekening met edge cases.
- Bij complexe taken (9-10): Claude is significant beter. DeepSeek begint fouten te maken bij langere codebases en vergeet eerdere instructies.
Qua prijs: DeepSeek is ~10x goedkoper per token. Voor simpele scripting taken is het dus prima. Maar voor serieus development werk zou ik Claude blijven gebruiken.
Caveat: dit is mijn eigen test, niet wetenschappelijk. En modellen worden snel beter. Maar op dit moment is mijn conclusie: DeepSeek voor quick scripts, Claude voor alles wat complexer is.
Interessante test. Mijn ervaring is vergelijkbaar. DeepSeek is ook sterker in Python dan in TypeScript, viel mij op. Voor data scripts gebruik ik het regelmatig.
Heb je ook Gemini 2.5 Pro meegenomen? Die zit er qua code kwaliteit echt tussenin en heeft een enorm context window. Voor grote refactors gebruik ik die tegenwoordig.
Mooie vergelijking. In het boek De 4 Prompting Disciplines wordt er ook ingegaan op hoe je je prompts kunt optimaliseren per model - elk model reageert net iets anders op dezelfde instructies. Kan handig zijn voor dit soort benchmarks.