Interhuman AI, Inter 2’nin tereddüt ve şüphecilikten strese kadar 10 konuşma sinyalini ve genel etkileşim düzeyini algıladığını belirtiyor. 2023’te Kopenhag’da kurulan şirket, konuşma yapay zekâsı, mülakat koçluğu ve araştırma gibi alanlarda kullanılabilecek bir “sosyal zekâ katmanı” geliştiriyor.
YayımlayanGPT-6 Luna ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: How is Copenhagen-based Interhuman AI developing artificial social intelligence through its proprietary Inter-2 model, and what does the mod. Article summary: Interhuman AI is building a “social intelligence” layer that other AI systems can use to interpret not just what someone says, but how they say it. Its proprietary Inter-2 model combines text, audio and video to identify. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Bir yapay zekâ, söylenen sözlerin yanı sıra ses tonuna, yüz ifadesine ve beden diline de bakarak konuşmaya nasıl karşılık vermesi gerektiğini anlayabilir mi? Kopenhag merkezli Interhuman AI, Inter-2 modeliyle bu soruya yanıt arıyor. Şirketin “sosyal zekâ katmanı” olarak tanımladığı teknoloji, yapay zekâ sistemlerinin konuşmadaki sosyal ipuçlarını gerçek zamanlı analiz etmesini amaçlıyor. Ancak modelin çıktıları gözlemlenebilir davranışlara ilişkin tahminler olarak görülmeli; bir kişinin düşünce veya duygularını kesin biçimde okuduğunun kanıtı sayılmamalı. 2
5
Modelin bildirdiği 10 sinyal şunlar: uzlaşma, karşı çıkma, şüphecilik, özgüven, tereddüt, hayal kırıklığı, ilgi, belirsizlik, kafa karışıklığı ve stres. Bunlara genel bir etkileşim durumu da eşlik ediyor. 18
Amaç, konuşmada kullanılan kelimeleri sesin aktarılış biçimi, yüz ifadesi ve beden dili gibi ipuçlarıyla birlikte değerlendirmek. Tech.eu, Inter-2’nin metin, ses ve videodaki sinyalleri gerçek zamanlı analiz ettiğini aktarıyor. Model listesinde ise ses içeren videodan sinyal tespiti tarif ediliyor. Bu bilgiler çoklu veri türlerinin kullanıldığını gösterse de her ürün ayarında her girdinin nasıl işlendiğini bütünüyle açıklamıyor. 2
5
18
Interhuman AI, 2023’te Kopenhag’da kuruldu. Kurucu ortakları arasında Paula Petcu, Frederik Sally ve Line Clemmensen bulunuyor. 1
7
9
Şirketin çıkış noktası, bir yapay zekâ asistanının uygun bir yanıt verebilmesi için yalnızca konuşma dökümüne ihtiyaç duymayabileceği fikri. Örneğin asistan, kullanıcının kafasının karıştığına ya da konuşmadan koptuğuna işaret eden sinyalleri fark ederse etkileşimini buna göre değiştirebilir. Tech.eu, şirketin yaklaşımını büyük dil modellerine ses ve video analizi eklemek olarak anlatıyor. 2
Bu, ürünün hedefidir; modelin her koşulda bir kişinin niyetini doğru çıkarabildiğinin kanıtı değildir. Bir duraklama, yüz ifadesi veya ses tonundaki değişiklik farklı nedenlerden kaynaklanabilir. Bu nedenle tek bir sinyal, teşhis ya da herkes için geçerli bir yorum gibi ele alınmamalıdır.
Interhuman, konuşma tabanlı yapay zekâ ve mülakat koçluğunu olası kullanım alanları arasında gösteriyor. Şirketin internet sitesinde, deneme mülakatlarında anlatım biçimine odaklanan bir koçluk örneği yer alıyor. Araştırma mülakatlarına ilişkin şirket materyallerinde ise sinyallerin yanıtın ilgili bölümleriyle eşleştirilmesi anlatılıyor. Bu araştırma örneği, Inter-2’nin değil daha önceki Inter-1 modelinin kullanımını konu ediyor; dolayısıyla aynı özelliklerin Inter-2’nin her kullanımında bulunduğunu göstermiyor. 5
24
Bu örnekler, sosyal sinyal analizinin koçluğa veya araştırmacıların mülakatları gözden geçirmesine nasıl destek olabileceğini gösteriyor. Ancak tek başına, modelin farklı kişilerde, kültürlerde ya da bağlamlarda ne kadar isabetli çalıştığını kanıtlamıyor. Mevcut kaynaklar bu performansı bağımsız olarak değerlendirmeye yetecek ayrıntıyı sunmuyor.
Interhuman, önceki modeli Inter-1’in hangi davranış ipuçlarının bir sinyal değerlendirmesine katkı verdiğini açıklayabildiğini belirtiyor. Şirket ayrıca mülakat yanıtlarındaki sinyalleri belirli ifadelere bağladığı bir kullanım örneği paylaşıyor. Bu tür açıklamalar sunulduğunda şeffaflığa katkı sağlayabilir; ancak kaynaklar, tüm Inter-2 çıktılarının aynı açıklama ve izlenebilirlik özelliklerine sahip olduğunu doğrulamıyor. 25
24
Şirketin kullanım koşulları, iş yeri ve eğitim ortamlarında kişilerin duygularını çıkarsamak gibi bazı kullanımları kısıtlıyor. Öte yandan mevcut materyaller veri saklama süreleri, rıza süreçleri veya bu kısıtlamaların uygulamada nasıl denetlendiği hakkında yeterli bilgi vermiyor. 19
Teknoloji yüzleri, sesleri ve konuşmaları analiz ettiği için bu açık sorular önem taşıyor. Sosyal ipuçları yanlış yorumlanabilir veya gözetim amacıyla kullanılabilir. Mevcut kanıtlar, Interhuman’ın güvenlik önlemlerinin bu risklerin her birini nasıl ele aldığını ortaya koymuyor.
Burada incelenen haber ve şirket materyalleri, Inter-2’nin mevcut çoklu veri türlerine dayalı yaklaşımını anlatıyor; ancak yalnızca sesle analiz, birden fazla kişinin yer aldığı konuşmalar, sonraki modeller veya Avrupa dışına açılma için belirli bir takvim ya da teknik taahhüt doğrulamıyor. Bunları duyurulmuş özellikler veya tarihler değil, henüz yanıtlanmamış sorular olarak değerlendirmek gerekiyor. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Interhuman AI, Inter 2’nin tereddüt ve şüphecilikten strese kadar 10 konuşma sinyalini ve genel etkileşim düzeyini algıladığını belirtiyor.
Interhuman AI, Inter 2’nin tereddüt ve şüphecilikten strese kadar 10 konuşma sinyalini ve genel etkileşim düzeyini algıladığını belirtiyor. 2023’te Kopenhag’da kurulan şirket, konuşma yapay zekâsı, mülakat koçluğu ve araştırma gibi alanlarda kullanılabilecek bir “sosyal zekâ katmanı” geliştiriyor.
Şirketin kullanım koşulları bazı kullanımları kısıtlıyor; ancak ayrıntılı veri saklama uygulamaları veya yalnızca sesle ya da birden fazla kişiyle konuşmaya ilişkin doğrulanmış bir yol haritası açıklanmıyor.