Hoşgeldin Misafir

DeepSeek’ten Yeni Görsel Yapay Zeka Modeli: Metin ve Görselleri Aynı Anda Anlayabiliyor

Yasar7880

İzmir
1 Mar 2024
854 Mesaj
TIM Görevleri
1

Aktiflik

Seviye

Deneyim

TIM / GÖREV:
Sevgili Turkhacks okurları,

Yapay zeka yarışında son dönemin en dikkat çekici isimlerinden biri hiç şüphesiz DeepSeek.
Özellikle güçlü dil modelleri ve düşük maliyetli yapay zeka yaklaşımıyla kısa sürede büyük ses getiren şirket, şimdi de farklı bir alana daha güçlü şekilde giriş yapıyor.
DeepSeek, DeepSeek-V4-Flash-Vision-Exp isimli yeni deneysel multimodal modelini kullanıma açtı.
Modelin en önemli özelliği ise adından da anlaşılacağı gibi görüntüleri anlayabilmesi.
Yani artık DeepSeek'e yalnızca bir metin yazıp cevap beklemek zorunda değilsiniz.
Bir görüntü gönderebilir, görüntüyle ilgili soru sorabilir ve aynı isteğin içerisinde hem metin hem de görsel kullanabilirsiniz. DeepSeek'in resmi dokümantasyonuna göre model; fotoğrafları açıklayabiliyor, ekran görüntülerindeki yazıları okuyabiliyor, grafik ve tabloları analiz edebiliyor.


Peki bu neden önemli?

Çünkü yapay zeka yarışında artık yalnızca "kim daha iyi yazıyor?" sorusu sorulmuyor.
Kim görüntüyü, metni ve araçları birlikte anlayabiliyor?
Asıl yarış artık burada.

https%3A%2F%2Fdev-to-uploads.s3.amazonaws.com%2Fuploads%2Farticles%2Fu7mb3lp5vk7aoatiz7rp.png


DeepSeek’in Yeni Modeli Tam Olarak Ne?​

DeepSeek-V4-Flash-Vision-Exp, DeepSeek-V4-Flash mimarisinin üzerine görsel yetenekler ekleyen deneysel bir multimodal model.
DeepSeek'in açıklamasına göre model, mevcut V4-Flash'ın metin tarafındaki yeteneklerini korurken görsel anlayış kabiliyeti kazanacak şekilde geliştirildi.
Buradaki "multimodal" kelimesi önemli.
Multimodal yapay zeka, farklı veri türlerini aynı sistem içerisinde işleyebilen modelleri ifade ediyor.

Örneğin:

turkhacs_deepseek.jpg


Yani kullanıcı artık sadece "bana bunu anlat" demiyor.
İsterse:

"Bu ekran görüntüsündeki hatanın sebebi nedir?"
diye sorabiliyor.

İşte multimodal yapay zekanın asıl gücü burada ortaya çıkıyor.



Metin ve Görseli Aynı Anda Anlayabiliyor​

Modelin en önemli özelliklerinden biri, görseli tek başına analiz etmek yerine görsel ile metni aynı istek içerisinde değerlendirebilmesi.
Örneğin bir ekran görüntüsü gönderdiniz.

Ardından:

"Buradaki hata neden oluşuyor ve nasıl düzeltebilirim?"
diye sordunuz.

Model hem ekran görüntüsünü hem de yazılı talimatınızı birlikte değerlendirebiliyor.
Ya da bir grafik gönderdiniz ve:

"Son üç aydaki düşüşün en önemli nedenini açıkla."
dediniz.

Burada model yalnızca görseldeki nesneleri tanımaya çalışmıyor.
Görseldeki bilgiyi kullanıcı tarafından verilen metinle birleştirerek anlamlandırmaya çalışıyor.
DeepSeek'in resmi Vision API dokümantasyonu da tam olarak bu kullanım modelini destekliyor.



Ekran Görüntülerini Okuyabilmesi Neden Önemli?​

Bence bu modelin en kullanışlı taraflarından biri ekran görüntüsü analizi.
Çünkü bilgisayar kullanan herkes zaman zaman ekran görüntüsü üzerinden yardım almak istiyor.

Örneğin:

  • Windows hata mesajı
  • Java exception ekranı
  • Linux terminal çıktısı
  • Web sitesi hatası
  • Excel tablosu
  • Grafik
  • Uygulama arayüzü
  • Kod editörü
  • Sistem ayarları
gibi içerikleri modele gösterebilirsiniz.
Model görseldeki yazıları okuyup bunlarla ilgili sorularınızı cevaplayabiliyor.
DeepSeek bunu yalnızca teorik bir özellik olarak bırakmıyor. Vision API doğrudan ekran görüntülerinden metin okuma ve grafik analizi gibi kullanım senaryolarını destekliyor.
Bu özellikle yazılımcılar için oldukça kullanışlı olabilir.


Yazılımcılar İçin Yeni Bir Yardımcı Geliyor​

Şimdi bir yazılımcı olduğunuzu düşünün.
Kodunuz çalışmıyor.
Terminalde bir hata çıkıyor.
Normalde hatayı kopyalayıp yapay zekaya göndermeniz gerekiyor.
Ama bazen hata mesajı uzun oluyor.
Bazen hata bir IDE penceresinde.
Bazen de problem koddan ziyade uygulamanın görsel arayüzünde.
Yeni DeepSeek modeliyle ekran görüntüsünü doğrudan gönderip sorabilirsiniz.

Örneğin:

"Bu hata neden oluşuyor? Kodum Java Spring Boot uygulaması. Sorunu nasıl çözebilirim?"

Burada yapay zeka hem ekran görüntüsünü hem de açıklamanızı değerlendirebilir.
Bu da yapay zekanın klasik chatbot anlayışından biraz daha ileri gitmesi anlamına geliyor.


Grafik ve Tabloları da Analiz Edebiliyor​

Multimodal modellerin bir başka önemli kullanım alanı ise veri analizi.
Bir şirketin satış grafiğini düşünün.
Elinizde Excel dosyasından alınmış bir grafik var.
Normalde grafikteki değerleri tek tek modele aktarmanız gerekebilir.
Yeni nesil görsel modellerde ise grafik doğrudan sisteme verilebiliyor.

Modelden:

"En büyük değişim hangi dönemde yaşanmış?"
veya

"Bu grafikteki trendi özetle."
gibi sorular sorabiliyorsunuz.

DeepSeek'in Vision dokümantasyonunda grafik analizi de doğrudan desteklenen kullanım alanları arasında gösteriliyor.
Bu özellik özellikle raporlama ve araştırma tarafında önemli olabilir.


DeepSeek Bu Hamleyle Rakiplerine Yaklaşıyor​

Burada asıl dikkat çekici nokta ortaya çıkıyor.
OpenAI, Anthropic, Google ve Meta gibi şirketler uzun zamandır multimodal yapay zeka üzerinde çalışıyor.
Artık sadece yazı üreten modeller yeterli görülmüyor.
Çünkü gerçek dünya sadece yazılardan oluşmuyor.
Bir insan bilgisayarı kullanırken:
metin + görüntü + ekran + ses + araçlar
gibi farklı bilgi kaynaklarını aynı anda değerlendiriyor.
Yapay zekanın da buna yaklaşması gerekiyor.
DeepSeek'in yeni modeli tam olarak bu dönüşümün bir parçası.


En İlginç Tarafı: AI Agent Desteği​

DeepSeek-V4-Flash-Vision-Exp'in yalnızca görüntü tanıyan bir model olmaması daha önemli.
DeepSeek, modelin multimodal agent görevlerinde V4-Flash'a göre ciddi bir sıçrama yaptığını ve performansının kendi açıklamasına göre Opus-4.8'e yaklaştığını belirtiyor.
Buradaki AI Agent kavramı oldukça önemli.
Çünkü yapay zeka ajanları yalnızca soruya cevap vermek yerine görev gerçekleştirmeye çalışıyor.

Örneğin:


  1. Ekranı inceliyor.
  2. Kullanıcının istediğini anlıyor.
  3. Bir uygulamayı açıyor.
  4. Gerekli bilgileri buluyor.
  5. Bir işlem gerçekleştiriyor.
  6. Sonucu kontrol ediyor.
  7. Gerekirse işlemi tekrarlıyor.
Görüntüyü anlayabilen bir model bu sürecin çok daha önemli bir parçası haline geliyor.
Çünkü bilgisayar ekranı aslında insanın bilgisayarla iletişim kurduğu ana alan.


DeepSeek'in Vision Modeli Nasıl Kullanılıyor?​

Model şu anda DeepSeek API üzerinden deneysel olarak kullanılabiliyor.

Model adı:

deepseek-v4-flash-vision-exp
olarak belirtiliyor.
Geliştiriciler görselleri farklı yöntemlerle modele gönderebiliyor.
DeepSeek'in resmi API'si:


  • Base64
  • Harici görsel URL'si
  • Files API
yöntemlerini destekliyor.
Ayrıca OpenAI uyumlu Chat Completions ve Responses API yanında Anthropic uyumlu Messages API desteği de bulunuyor.
Bu da geliştiricilerin mevcut yapay zeka projelerine modeli entegre etmesini kolaylaştırabilecek önemli bir ayrıntı.


Kaç Görsel Gönderilebiliyor?​

Burada da oldukça ilginç teknik detaylar var.
DeepSeek'in dokümantasyonuna göre tek bir istekte 600'e kadar görsel destekleniyor.
Tek görsel için kullanılan yönteme göre dosya boyutu sınırları bulunuyor ve toplam istek boyutu için de limitler uygulanıyor. Görseller JPEG, PNG, GIF ve WebP formatlarında destekleniyor.
Ayrıca görseller token olarak işleniyor.
DeepSeek, görseller için görüntü boyutunu otomatik olarak düzenliyor ve bir görüntünün token kullanımını 384 tokena kadar sınırlandırıyor.
Bu detay özellikle API maliyetleri açısından önemli.
Çünkü multimodal sistemlerde görüntüleri işlemek de hesaplama maliyeti oluşturuyor.


DeepSeek'in Avantajı Maliyet Olabilir​

DeepSeek'in bugüne kadar en dikkat çekici stratejilerinden biri maliyet tarafında agresif olmasıydı.
Yeni Vision modeli de mevcut V4-Flash fiyatlandırması üzerinden görsel token kullanımını destekliyor. DeepSeek'in açıklamasına göre görseller token olarak ücretlendiriliyor ve görüntü başına 384 tokene kadar kullanım söz konusu.
Bu durum geliştiriciler için önemli.
Çünkü görüntü anlayabilen bir modeli kullanmak istiyorsanız yalnızca performansa değil, istek başına maliyete de bakmanız gerekiyor.


Peki Model Gerçekten Ne Kadar Güçlü?​

Burada yine biraz dikkatli olmak gerekiyor.
DeepSeek'in yayınladığı testlerde V4-Flash-Vision-Exp özellikle multimodal agent görevlerinde V4-Flash'a göre ciddi gelişim gösteriyor.
Şirketin paylaştığı sonuçlardan bazıları şöyle:


turkhacs-benchmark.jpg


Bu sonuçlar DeepSeek'in resmi değerlendirmeleri. Dolayısıyla rakiplerle yapılacak kesin performans karşılaştırmalarında bağımsız testlere de bakmak gerekiyor.
Ama sonuçların bize gösterdiği önemli bir şey var.
DeepSeek artık yalnızca "metin üreten yapay zeka" tarafında yarışmıyor.
Görsel anlayış + reasoning + agent üçlüsünü aynı sistem içerisinde birleştirmeye çalışıyor.


DeepSeek İçin Yeni Bir Dönem Başlıyor​

DeepSeek'in V3 ve önceki modelleriyle elde ettiği başarının önemli kısmı dil, matematik, kodlama ve reasoning tarafındaydı.
V4 ailesiyle birlikte şirket çok daha geniş bir alana yöneliyor.
Önce V4-Pro ve V4-Flash geldi.
Şimdi ise Vision modeliyle görüntü anlayışı ekleniyor.
DeepSeek'in resmi model listesinde V4'ün Nisan 2026'da yayınlandığı görülüyor.
Bu gelişme şirketin yapay zekayı daha genel amaçlı bir sisteme dönüştürme çabasını gösteriyor.


Yapay Zeka Yarışında Görsel Anlayış Neden Önemli?​

Çünkü geleceğin yapay zekası sadece sizin yazdığınız kelimeleri okumayacak.
Bilgisayar ekranını görecek.
Telefon ekranını görecek.
Grafikleri okuyacak.
Kameradan gelen görüntüyü analiz edecek.
Belgeleri inceleyecek.
Robotun çevresini anlayacak.
Ve bütün bunları kullanıcıdan gelen metin talimatlarıyla birleştirecek.
Aslında insanın dünyayı algılama biçimine biraz daha yaklaşan bir sistem ortaya çıkıyor.
Bu nedenle multimodal modeller, yapay zeka yarışının en kritik alanlarından biri haline gelmiş durumda.


Robotik Tarafında da Kullanılabilir​

DeepSeek'in görsel anlayış çalışmalarının gelecekte robotik alanına etkisi de olabilir.
Nitekim DeepSeek Ağustos 2026'da Unitree'nin halka arzına 20,8 milyon dolarlık yatırım yaptı ve iki şirketin insansı robotlar için yapay zeka modelleri konusunda iş birliği yapacağı açıklandı.
Bu oldukça ilginç bir gelişme.
Çünkü robotun dünyayı anlaması için yalnızca dil modeline sahip olması yetmez.



Robotun:
görmesi → anlaması → karar vermesi → hareket etmesi
gerekiyor.
Dolayısıyla görsel reasoning gelecekte robotik yapay zekanın da temel parçalarından biri olabilir.


OpenAI ve Anthropic İçin Yeni Bir Rakip Daha​

DeepSeek'in bu hamlesi OpenAI ve Anthropic'in doğrudan karşısına geçmekten çok, rekabet alanını genişletiyor.
Çünkü artık şirketler yalnızca en iyi metin modelini geliştirmeye çalışmıyor.

Aynı zamanda:



Alan​
Yeni Rekabet​
MetinGüçlü reasoning
GörüntüVision modelleri
KodlamaAI coding
AjanlarAutonomous agents
Araç kullanımıTool calling
Bilgisayar kullanımıComputer use
RobotikEmbodied AI

gibi birçok alanda aynı anda yarışıyor.
DeepSeek'in Vision modeli bu tablonun özellikle görüntü + ajan tarafında önemli bir adım.


Peki Kullanıcılar İçin Ne Değişecek?​

Aslında uzun vadede oldukça fazla şey değişebilir.
Bugün yapay zekaya:
"Bu yazıyı özetle."
diyoruz.
Yarın:

"Bu PDF'yi incele, grafiklerdeki sorunları bul ve bana rapor hazırla."

diyebiliriz.
Bugün:

"Bu kodu düzelt."
diyoruz.
Yarın:

"Ekrandaki uygulamayı incele, hatayı bul ve düzeltme adımlarını uygula."
diyebiliriz.
Aradaki fark oldukça büyük.
Çünkü yapay zeka artık yalnızca verdiğiniz metni değil, çalıştığınız ortamı da anlamaya başlıyor.




Sevgili Olurlar DeepSeek Yine Yarışın İçinde​

DeepSeek-V4-Flash-Vision-Exp henüz deneysel bir model.
Bu nedenle bugünden "OpenAI ve Anthropic'i geçti" demek doğru olmaz.
Ancak ortaya çıkan tablo oldukça net.

DeepSeek artık multimodal yapay zeka yarışına da güçlü şekilde dahil oluyor.

Metni anlayabiliyor.
Görüntüyü anlayabiliyor.
Ekran görüntülerini analiz edebiliyor.

Grafikleri okuyabiliyor.
Kodlama görevlerinde kullanılabiliyor.
Ve bunları AI agent sistemleriyle birleştirmeye çalışıyor.
Bence asıl önemli nokta da burada.
Yapay zeka dünyasında yarış artık sadece "en akıllı chatbot kim?" yarışması değil.
Artık soru şu:
Kim dünyayı daha iyi görebiliyor, anlayabiliyor ve gördüğü bilgiyle gerçek bir iş yapabiliyor?
DeepSeek'in yeni Vision modeli de bu yarışta Çin tarafının elini biraz daha güçlendiren önemli bir hamle.
Önümüzdeki dönemde OpenAI, Anthropic, Google, Meta ve Çinli yapay zeka şirketlerinden çok daha gelişmiş multimodal modeller görmemiz oldukça muhtemel.
Ve açıkçası yapay zekanın gerçekten "iş yapan" bir yardımcıya dönüşeceği dönem de tam olarak burada başlıyor.
Bir dahaki makalemizde görüşene kadar mavi ekransız ve sorunsuz sistemlerle çalışmanız dileği ile.


btn1pyf.md.png




​