charts · trends
📨 Recent posts
32 total🚀 مونشات از کیمی K3 رونمایی کرد شرکت چینی Moonshot AI امروز قدرتمندترین مدل پرچمدار خودش، Kimi K3، رو رسما معرفی کرد. 🔹 پنجرهی زمینه تا ۱ میلیون توکن 🔹 بهبود قابلتوجه در کدنویسی، تولید سهبعدی و وظایف دانشی پیچیده 🔹 طبق برخی نشتها و تستهای کاربران، حدود ۲.۵ تریلیون پارامتر دارد (این رقم هنوز رسما تأیید نشده) 🔹 در برخی بنچمارکهای کدنویسی از GPT-5.5 جلو زده این عرضه فقط ۳ ماه بعد از متنباز ش…
پارت ۱ تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه. اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای…
پارت ۱ تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه. اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای فرانتیر ۲۰۲۶ دقیقاً از چه نسخههایی از distillation استفاده میکنن: 1️⃣ معلم بزرگ و دانشآموز کوچیک (روش کلاسیک): مثل Gemma 3 و DeepSeek-R1-…
مدل SenseNova-Vision-7B-MoT از تیم SenseNova برخلاف VLM های معمول (مثل Qwen-VL) که فقط تصویر میگیرن و متن تولید میکنن، این مدل هم متن تولید میکنه هم تصویر — یعنی میتونه خروجیهایی مثل نقشه عمق، ماسک سگمنتیشن یا نقشه نقاط سهبعدی رو مستقیماً و بدون هد اختصاصی برای هر تسک بسازه - تشخیص اشیا، لوکالیزیشن، OCR، گراندینگ رابط کاربری، کیپوینت - تخمین عمق و نرمال سطح - سگمنتیشن (رفرنسی، استدلالی، تع…
مدل LocateAnything از NVIDIA؛ حذف یکی از بزرگترین گلوگاههای مدلهای Vision-Language مدل جدید LocateAnything انویدیا مشکل کندی مدلهای تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده: Parallel Box Decoding (PBD) . مسئله چی بود؟ مدلهای VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و بهصورت متوالی تولید میکنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل…
📊 بهرهوری توکن در Agent Arena بنچ مارک Agent Arena عملکرد ایجنتهای هوش مصنوعی رو روی تسکهای واقعی (نوشتن کد، ساخت اسلاید، تحقیق وب، توسعه اپ، تحلیل اسناد) با ابزارهای search، filesystem و terminal میسنجه. نکته کلیدی اینه که مصرف توکن بیشتر همیشه به کیفیت بهتر منجر نمیشه. این نمودار هر مدل را نشون میده بهبود عملکرد (عمودی) در برابر میانه توکن مصرفی (افقی) — و یک خط روند کلی ترسیم میکنه. فاص…
https://github.com/huggingface/peft/blob/main/examples/mica_finetuning/README.md
روش MiCA جایگزین قدرتمند LoRA در Fine-tuning یه روش جدید به اسم MiCA یا (MinoCA Component Adaptation) به کتابخونه PEFT هاگینگفیس اضافه شده و نتایجش چشمگیره. ایده اصلی تکنیک LoRA روی بخشهایی از مدل تمرکز میکنه که بیشترین استفاده رو دارن. MiCA برعکس عمل میکنه — روی فضاهای کمتر استفادهشده (minor singular subspace) تنظیم میکنه تا دانش جدید جذب بشه بدون اینکه دانش قبلی از بین بره. نتایج روی ۳ مد…
🖼️ Krea 2 Turbo مدل تولید تصویر اوپنسورس با ۱۲ میلیارد پارامتر مجپوعه Krea AI اولین مدل بومی خودش رو منتشر کرد و وزنها رو هم اوپنسورس کرده. ✨ چرا جالبه؟ ▸ تولید تصویر ۲K در ~۲ ثانیه روی GPU معمولی ▸ فقط ۸ inference step، بدون CFG ▸ رتبه اول بین لبهای مستقل در لیدربورد Artificial Analysis ▸ اختلاف تنها ۰.۱۴ امتیاز با GPT Image در style fidelity 🔗 لینکها HuggingFace: https://huggingface.co/kre…
🦅 مدل Ornith-1.0 — مدل متنباز با قابلیت خودبهبودی برای Agentic Coding یه خانواده مدل جدید از DeepReinforce که روی کدنویسی عاملی (Agentic Coding) تخصص داره. از نسخه 9B برای edge devices تا 397B در مقیاس frontier. 🧠 نوآوری اصلی: بهجای اینکه scaffold کدنویسی رو انسان طراحی کنه، مدل با RL هم راهحل و هم scaffold رو خودش یاد میگیره و هر دو رو با هم بهینه میکنه — یعنی هر بار بهتر میشه. 📊 نسخه 35B…
🗂️ تبدیل اسناد به چانکهای آماده برای RAG با Chunkr یه ابزار متنباز برای پردازش هوشمند اسناد؛ PDF، PowerPoint، Word و تصویر رو میگیره و خروجی ساختاریافته برای پایپلاینهای RAG و LLM تولید میکنه. ✅ تحلیل لایهبندی سند با OCR و Bounding Box ✅ خروجی HTML و Markdown ساختاریافته ✅ پردازش با مدلهای Vision-Language ✅ Self-hosted با Docker Compose و پشتیبانی از LLMهای مختلف 🔗 مستندات: https://docs.c…
فاین تیون کردن مدلهای MoE با یه خط کد، ۳.۷ برابر سریعتر! اخیرا NVIDIA یه کتابخونه open-source معرفی کرده به اسم NeMo AutoModel که روی Transformers v5 هاگینگفیس ساخته شده. فقط یه خط import عوض میشه: 🔹 تا ۳.۷ برابر throughput بالاتر 🔹 تا ۳۲٪ حافظه GPU کمتر 🔹 امکان fine-tune مدل ۵۵۰B که با Transformers خالص اصلاً در حافظه جا نمیشه سه تکنیک به کار برده: Expert Parallelism، DeepEP fused dispatch،…
channel description
آموزش تخصصی LLM و Hugging face گروه مباحثه: @llm_group
channel info
similar channels/ai
tapswap community
TapSwap Community is a channel focused on converting taps into a financial tool, utilizing a bot for interaction.
Bum’s Corner 📦
BUM's Corner explores the evolution of a game IP into an AI-native ecosystem with digital companions.
DuckChain Announcement
DuckChain is a Telegram AI chain enabling users to engage with crypto through AI, EVM, and other technologies.
Need Services
Need Services offers a variety of digital services including VPNs, game top-ups, verification, eSIMs, and AI tools.
Hi, AI • Новости технологий
A Telegram channel providing news and updates on artificial intelligence and neural networks.
JGGL Official
JGGL is a social network focused on music creation and sharing, featuring an AI-powered track generator.
