Rumah Peranti teknologi AI Chitrarth-1: VLM berbilang bahasa oleh Makmal Krutrim AI

Chitrarth-1: VLM berbilang bahasa oleh Makmal Krutrim AI

Mar 03, 2025 pm 06:22 PM

Landskap AI India berkembang pesat, dengan kemajuan dan inovasi yang ketara muncul. Krutrim AI Labs, sebuah syarikat kumpulan Ola, adalah pemain utama dalam pertumbuhan ini, baru-baru ini melancarkan Chitrarth-1, model bahasa penglihatan yang terobosan (VLM). Direka untuk konteks linguistik dan budaya India yang pelbagai, Chitrarth-1 menyokong sepuluh bahasa India utama ditambah bahasa Inggeris, menangani keperluan kritikal untuk penyelesaian AI berbilang bahasa. Artikel ini menyelidiki Chitrarth-1 dan implikasinya untuk keupayaan AI yang berkembang di India.

Jadual Kandungan

  • Apa itu Chitrarth-1?
  • data latihan dan metodologi
    • Fasa 1: Penyesuai Pra-Training
    • Fasa 2: Penalaan Arahan
  • Prestasi dan penanda aras
  • Mengakses Chitrarth-1
  • chitrarth-1 dalam tindakan
  • Kesimpulan

Apa itu Chitrarth-1?

Chitrarth-1 (menggabungkan "chitra"-imej dan "artha"-makna) adalah parameter 7.5 bilion VLM yang mengintegrasikan bahasa lanjutan dan pemprosesan penglihatan. Dibina untuk memenuhi keperluan linguistik India yang pelbagai, ia menyokong Hindi, Bengali, Telugu, Tamil, Marathi, Gujarati, Kannada, Malayalam, Odia, Assam, dan Inggeris. Model ini merangkumi komitmen Krutrim untuk membangunkan AI "untuk negara kita, negara kita, dan bagi warganegara kita." Penggunaan dataset yang kaya dan berbilang bahasa meminimumkan kecenderungan dan memastikan prestasi yang mantap merentasi bahasa indik dan bahasa Inggeris, mempromosikan akses AI yang saksama. Penyelidikan mengenai Chitrarth-1 diterbitkan dalam jurnal akademik terkemuka, termasuk Neurips dan Persidangan Kesembilan mengenai Terjemahan Mesin.

Chitrarth-1 menggunakan Krutrim-7b LLM sebagai asasnya, dipertingkatkan oleh pengekod penglihatan berdasarkan model SIGLIP (SIGLIP-SO400M-PATCH14-384). Komponen seni bina utama termasuk:

pengekod visi siglip pra-terlatih untuk pengekstrakan ciri imej.

    Lapisan pemetaan linear yang boleh dilatih untuk ciri -ciri imej projek ke ruang token LLM.
  • penalaan halus dengan arahan teks-teks imej yang mengikuti untuk prestasi multimodal yang lebih baik.
  • Data dan Metodologi Latihan

Latihan Chitrarth-1 melibatkan dua fasa menggunakan dataset yang luas dan berbilang bahasa:

Fasa 1: Penyesuai Pra-Training Chitrarth-1: A Multilingual VLM by Krutrim AI Labs

  • pra-terlatih pada dataset yang pelbagai diterjemahkan ke dalam pelbagai bahasa indik menggunakan model sumber terbuka.
  • mengekalkan perwakilan bahasa Inggeris dan indik yang seimbang untuk memastikan prestasi yang saksama.
  • Direka untuk mengelakkan kecenderungan ke arah mana -mana bahasa tunggal, mengoptimumkan untuk kecekapan dan keteguhan.

Fasa 2: Penalaan Arahan

  • disesuaikan dengan dataset arahan yang kompleks untuk meningkatkan keupayaan penalaran multimodal.
  • menggunakan dataset penalaan arahan berasaskan Inggeris dan terjemahan berbilang bahasa.
  • termasuk dataset bahasa penglihatan yang memaparkan imej India yang pelbagai (personaliti, monumen, karya seni, masakan).
  • menggabungkan data teks bahasa Inggeris berkualiti tinggi untuk perwakilan domain yang seimbang.

Prestasi dan penanda aras

Chitrarth-1: A Multilingual VLM by Krutrim AI Labs

Chitrarth-1 telah diuji dengan ketat terhadap VLMs terkemuka seperti Idefics 2 (7B) dan Palo 7B, secara konsisten mengatasi mereka pada pelbagai tanda aras sambil mengekalkan daya saing mengenai tugas-tugas seperti TextVQA dan Vizwiz. Ia juga melampaui Llama 3.2 11B Visi Mengarah dalam metrik utama. Krutrim memperkenalkan Bharatbench, sebuah suite penilaian baru untuk sepuluh bahasa indik yang kurang mendapat sumber dalam tiga tugas, mewujudkan garis dasar untuk penyelidikan masa depan dan menonjolkan keupayaan Chitrarth-1 untuk mengendalikan bahasa-bahasa ini dengan berkesan. Contoh hasil bharatbench ditunjukkan di bawah:

Untuk maklumat lanjut, klik di sini.

Mengakses Chitrarth-1

Chitrarth-1 boleh diakses melalui:

  • Pakaian muka: Penggunaan langsung atau penalaan halus. (Klik di sini untuk melawat)
  • github: (kod yang disediakan dalam artikel asal)
  • awan krutrim: (klik di sini untuk meneroka)

Chitrarth-1: A Multilingual VLM by Krutrim AI Labs

chitrarth-1 dalam tindakan

Contoh keupayaan Chitrarth-1 termasuk analisis imej, generasi kapsyen imej, dan analisis skrin UI/UX (imej yang disediakan dalam artikel asal).

Chitrarth-1: A Multilingual VLM by Krutrim AI Labs Chitrarth-1: A Multilingual VLM by Krutrim AI Labs Chitrarth-1: A Multilingual VLM by Krutrim AI Labs

Kesimpulan

Krutrim AI Labs, pembahagian kumpulan OLA, komited untuk membina masa depan pengkomputeran AI. Dengan Chitrarth-1, dan persembahan lain seperti GPU sebagai perkhidmatan, AI Studio, dan banyak lagi, mereka mewujudkan standard baru untuk AI yang sensitif, budaya, memupuk landskap teknologi yang lebih adil.

Atas ialah kandungan terperinci Chitrarth-1: VLM berbilang bahasa oleh Makmal Krutrim AI. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan Laman Web ini
Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Alat AI Hot

Undresser.AI Undress

Undresser.AI Undress

Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover

AI Clothes Remover

Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool

Undress AI Tool

Gambar buka pakaian secara percuma

Clothoff.io

Clothoff.io

Penyingkiran pakaian AI

Video Face Swap

Video Face Swap

Tukar muka dalam mana-mana video dengan mudah menggunakan alat tukar muka AI percuma kami!

Alat panas

Notepad++7.3.1

Notepad++7.3.1

Editor kod yang mudah digunakan dan percuma

SublimeText3 versi Cina

SublimeText3 versi Cina

Versi Cina, sangat mudah digunakan

Hantar Studio 13.0.1

Hantar Studio 13.0.1

Persekitaran pembangunan bersepadu PHP yang berkuasa

Dreamweaver CS6

Dreamweaver CS6

Alat pembangunan web visual

SublimeText3 versi Mac

SublimeText3 versi Mac

Perisian penyuntingan kod peringkat Tuhan (SublimeText3)

Penjana Seni AI Terbaik (Percuma & amp; Dibayar) untuk projek kreatif Penjana Seni AI Terbaik (Percuma & amp; Dibayar) untuk projek kreatif Apr 02, 2025 pm 06:10 PM

Artikel ini mengkaji semula penjana seni AI atas, membincangkan ciri -ciri mereka, kesesuaian untuk projek kreatif, dan nilai. Ia menyerlahkan Midjourney sebagai nilai terbaik untuk profesional dan mengesyorkan Dall-E 2 untuk seni berkualiti tinggi dan disesuaikan.

Bermula dengan Meta Llama 3.2 - Analytics Vidhya Bermula dengan Meta Llama 3.2 - Analytics Vidhya Apr 11, 2025 pm 12:04 PM

Meta's Llama 3.2: Lompat ke hadapan dalam Multimodal dan Mobile AI META baru -baru ini melancarkan Llama 3.2, kemajuan yang ketara dalam AI yang memaparkan keupayaan penglihatan yang kuat dan model teks ringan yang dioptimumkan untuk peranti mudah alih. Membina kejayaan o

CHATBOTS AI terbaik berbanding (Chatgpt, Gemini, Claude & amp; Lagi) CHATBOTS AI terbaik berbanding (Chatgpt, Gemini, Claude & amp; Lagi) Apr 02, 2025 pm 06:09 PM

Artikel ini membandingkan chatbots AI seperti Chatgpt, Gemini, dan Claude, yang memberi tumpuan kepada ciri -ciri unik mereka, pilihan penyesuaian, dan prestasi dalam pemprosesan bahasa semula jadi dan kebolehpercayaan.

10 Pelanjutan pengekodan AI generatif dalam kod vs yang mesti anda pelajari 10 Pelanjutan pengekodan AI generatif dalam kod vs yang mesti anda pelajari Apr 13, 2025 am 01:14 AM

Hei ada, pengekodan ninja! Apa tugas yang berkaitan dengan pengekodan yang anda telah merancang untuk hari itu? Sebelum anda menyelam lebih jauh ke dalam blog ini, saya ingin anda memikirkan semua kesengsaraan yang berkaitan dengan pengekodan anda-lebih jauh menyenaraikan mereka. Selesai? - Let &#8217

Pembantu Menulis AI Teratas untuk Meningkatkan Penciptaan Kandungan Anda Pembantu Menulis AI Teratas untuk Meningkatkan Penciptaan Kandungan Anda Apr 02, 2025 pm 06:11 PM

Artikel ini membincangkan pembantu penulisan AI terkemuka seperti Grammarly, Jasper, Copy.ai, WriteSonic, dan Rytr, yang memberi tumpuan kepada ciri -ciri unik mereka untuk penciptaan kandungan. Ia berpendapat bahawa Jasper cemerlang dalam pengoptimuman SEO, sementara alat AI membantu mengekalkan nada terdiri

Menjual Strategi AI kepada Pekerja: Manifesto CEO Shopify Menjual Strategi AI kepada Pekerja: Manifesto CEO Shopify Apr 10, 2025 am 11:19 AM

Memo CEO Shopify Tobi Lütke baru -baru ini dengan berani mengisytiharkan penguasaan AI sebagai harapan asas bagi setiap pekerja, menandakan peralihan budaya yang signifikan dalam syarikat. Ini bukan trend seketika; Ini adalah paradigma operasi baru yang disatukan ke p

AV Bytes: Meta ' s llama 3.2, Google's Gemini 1.5, dan banyak lagi AV Bytes: Meta ' s llama 3.2, Google's Gemini 1.5, dan banyak lagi Apr 11, 2025 pm 12:01 PM

Landskap AI minggu ini: Badai kemajuan, pertimbangan etika, dan perdebatan pengawalseliaan. Pemain utama seperti Openai, Google, Meta, dan Microsoft telah melepaskan kemas kini, dari model baru yang terobosan ke peralihan penting di LE

Memilih Penjana Suara AI Terbaik: Pilihan Teratas Ditinjau Memilih Penjana Suara AI Terbaik: Pilihan Teratas Ditinjau Apr 02, 2025 pm 06:12 PM

Artikel ini mengulas penjana suara AI atas seperti Google Cloud, Amazon Polly, Microsoft Azure, IBM Watson, dan Descript, memberi tumpuan kepada ciri -ciri mereka, kualiti suara, dan kesesuaian untuk keperluan yang berbeza.

See all articles