পণ্যের খবর

অ্যান্ড্রয়েড বেঞ্চ ২.০: দীর্ঘমেয়াদী ও চ্যালেঞ্জিং কাজের মাধ্যমে সীমানা প্রসারিত করছে

৩ মিনিটের পাঠ
ম্যাথিউ ম্যাককালোর প্রোফাইল দেখুন
Matthew McCullough ভাইস প্রেসিডেন্ট, প্রোডাক্ট ম্যানেজমেন্ট, অ্যান্ড্রয়েড ডেভেলপার

যখন আমরা প্রথম অ্যান্ড্রয়েড বেঞ্চ চালু করি, তখন আমরা একটি শক্তিশালী ভিত্তি তৈরি করেছিলাম, যা মূল্যায়ন করে যে লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) কীভাবে ডেভেলপারদের বাস্তব অ্যান্ড্রয়েড কাজগুলোতে সহায়তা করে। যেহেতু এআই মডেল এবং এজেন্টগুলো দ্রুত বিকশিত হচ্ছে, আমরা আমাদের পদ্ধতিও আপডেট করে চলেছি, যেমন আমাদের বেঞ্চমার্ক ফ্রেমওয়ার্ককে হারবার ফ্রেমওয়ার্কের সাথে সামঞ্জস্যপূর্ণ করা। আজ আমরা লং-হরাইজন টাস্ক (LHT)-এর প্রথম সেট প্রকাশ করছি , যেগুলো হলো অত্যন্ত জটিল কাজ যা সম্পন্ন করতে একজন ইঞ্জিনিয়ারের বেশ কয়েক দিন বা এমনকি এক সপ্তাহও লেগে যেতে পারে। আমরা এজেন্টিক ইভ্যালুয়েশনও চালু করছি, যা সংশ্লিষ্ট মডেল প্রোভাইডারদের এজেন্টদের দিয়ে শুরু হবে। এই সংযোজনটি আমাদেরকে অ্যান্ড্রয়েড বেঞ্চ ২.০- তে নিয়ে এসেছে — এটি একটি বড় আপগ্রেড, যা এআই মডেল এবং এজেন্টদেরকে সেইসব বিশাল পরিসর, অস্পষ্টতা এবং জটিল বহু-ধাপের সমস্যা সমাধানের প্রেক্ষাপটে মূল্যায়ন করার জন্য ডিজাইন করা হয়েছে, যা আপনি প্রতিদিন মোকাবেলা করেন।

লিডারবোর্ডফাইনাল (1) (1).png
অ্যান্ড্রয়েড বেঞ্চ ২.০ লিডারবোর্ড

পর্যায়ক্রমিক সমাধান থেকে শুরু করে দীর্ঘমেয়াদী কাজ পর্যন্ত

অ্যান্ড্রয়েড বেঞ্চের প্রথম সংস্করণ, এবং এর মতো অন্যান্য প্রাথমিক এআই কোডিং বেঞ্চমার্কগুলো, বিদ্যমান রিপোজিটরিগুলোতে সামান্য পরিবর্তনের উপর মনোযোগ দিয়েছিল, যা অনেক ক্ষেত্রেই বাগ ফিক্স বা ছোটখাটো ফিচার রিকোয়েস্টের মধ্যে সীমাবদ্ধ ছিল। এটি ছিল সেই সময়ে এআই অ্যাসিস্ট্যান্সের সক্ষমতা এবং এর ব্যবহারের পদ্ধতিরই একটি প্রতিফলন।

আপনার ডেভেলপমেন্ট ওয়ার্কফ্লোর জন্য সবচেয়ে উপযুক্ত মডেল এবং কোডিং এজেন্ট খুঁজে পেতে আপনাকে সাহায্য করার এই প্রক্রিয়া অব্যাহত রাখতে, আমরা আমাদের মূল্যায়নের মানকে আরও উন্নত করেছি, যা আপনার AI-কে দেওয়া কাজের সাথে সামঞ্জস্যপূর্ণ। Android Bench 2.0 এই উচ্চাভিলাষী চ্যালেঞ্জগুলোকে প্রতিফলিত করে, যার LHT-গুলোর মধ্যে রয়েছে ডিপেন্ডেন্সি আপগ্রেড করা, নতুন ফিচার যোগ করা, একেবারে গোড়া থেকে অ্যাপ তৈরি করা, অথবা একটি ক্রস-প্ল্যাটফর্ম অ্যাপকে অ্যান্ড্রয়েডে রূপান্তর করা।

জটিল কাজগুলোর জন্য আরও সূক্ষ্ম মূল্যায়ন এবং নম্বর প্রদানের প্রয়োজন হয়।

কয়েক দিনব্যাপী ইঞ্জিনিয়ারিং কাজের ক্ষেত্রে, শুধু পাস বা ফেলের মতো দ্বিমুখী মূল্যায়ন পুরো চিত্রটি তুলে ধরে না।

উদাহরণস্বরূপ, একজন এজেন্ট হয়তো ৪০টি স্ক্রিনকে জেটপ্যাক কম্পোজে রিফ্যাক্টর করতে পারে, ডেটাবেস টেবিল সেট আপ করতে পারে এবং ৯০% রিকোয়ারমেন্ট পাস করতে পারে, কিন্তু একটিমাত্র এজ-কেস অ্যাসারশনে ব্যর্থ হতে পারে। বাইনারি স্কোরিং এই রানটিকে ০% রেটিং দেয়, যা মডেলটির আর্কিটেকচারাল সক্ষমতাকে আড়াল করে। আমরা কন্টিনিউয়াস স্কোরিং-এর দিকে অগ্রসর হচ্ছি, যা মডেল ডেভেলপমেন্টের জন্য এবং এআই আপনাকে কীভাবে সাহায্য করতে পারে তা বোঝার জন্য আরও অর্থবহ সংকেত প্রদান করবে।

আমরা কার্যকারিতা, ভিজ্যুয়াল ফিডেলিটি এবং রিগ্রেশন এড়ানোর মতো বিভিন্ন বিষয়ের সমন্বয়ে এই সমাপ্তির হার গণনা করি। এছাড়াও, মূল্যায়নের নির্দেশাবলী বা কাঠামোগত সীমাবদ্ধতা থেকে বিচ্যুতির জন্য আমরা বস্তুনিষ্ঠ স্কোরিং পেনাল্টি প্রয়োগ করি। আপডেট করা লিডারবোর্ডটি দেখুন এবং প্রতিটি মডেলের কার্ড ভিউতে ক্লিক করে পাসের হার, সমাপ্তির হার এবং প্রতি মডেল ও প্রতি টাস্কের গড় খরচের মতো অতিরিক্ত উপাদানগুলো দেখুন।

LHT-গুলোর জন্য সর্বোচ্চ পাসের হার প্রায় ২৮% , যা বেঞ্চমার্কের মূল টাস্কগুলোর প্রায় ৯১% হারের চেয়ে অনেক কম।

Screenshot 2026-09-16 at 3.18.23PM.png
মডেল কার্ড ভিউ আপনাকে প্রতিটি মডেলের শক্তি এবং দুর্বলতাগুলো খতিয়ে দেখার সুযোগ দেয়।

দীর্ঘমেয়াদী কাজগুলো এআই সহায়তার জন্য দরকারি অন্তর্দৃষ্টি উন্মোচন করে।

এআই দীর্ঘমেয়াদী কাজ কতটা ভালোভাবে সামলাতে পারে তা পরিমাপ করার পাশাপাশি, LHT ডেটাসেটটি আমাদের পরীক্ষিত মডেলগুলোর সবলতা ও দুর্বলতা সম্পর্কে আরও জানতে সাহায্য করে এবং আমরা আপনাকে আরও বাস্তবসম্মত নির্দেশনা প্রদান করি।

বিভিন্ন মডেল স্তরে, AI বিদ্যমান কোড রিফ্যাক্টর করার চেয়ে নতুন কোড লিখতে বেশি ভালো কাজ করে। রিফ্যাক্টর এবং মাইগ্রেশন আরও জটিল হয়ে ওঠে, কারণ এর সাফল্য কোডের পরিমাণের চেয়ে আর্কিটেকচারাল জটিলতার উপর বেশি নির্ভর করে।

মডেলগুলো সুপ্রতিষ্ঠিত ও সুনির্দিষ্ট রূপান্তরগুলোতে শক্তিশালী সক্ষমতা দেখায়, যেমন জাভা থেকে কোটলিনে রূপান্তর করা, রেট্রোফিটের পরিবর্তে কেটর ব্যবহার করা, বা একটি ভিউমডেল লেয়ার যুক্ত করা। তারা এই প্যাটার্নগুলো ধারাবাহিকভাবে প্রয়োগ করে, এমনকি ১২৫টিরও বেশি ফাইল এবং ৮,০০০টিরও বেশি লাইনের কোড জুড়েও।

তবে, যখন কোনো কাজের জন্য রানটাইম ভ্যালিডেশনের প্রয়োজন হয় (যেমন ডিপেন্ডেন্সি ইনজেকশন গ্রাফের অনুপস্থিতি), ফ্রেমওয়ার্কে বড় ধরনের পরিবর্তন আসে, অথবা অপ্রকাশিত লাইব্রেরি সম্পর্কে জ্ঞানের ঘাটতি দেখা দেয়, তখন মডেলগুলো সমস্যার সম্মুখীন হয়। ক্রস-প্ল্যাটফর্ম অ্যাপগুলোকে অ্যান্ড্রয়েডে পোর্ট করা এখনও একটি অমীমাংসিত চ্যালেঞ্জ—কোনো মডেলই ১০০% পাস রেট অর্জন করতে পারে না, এবং অত্যাধুনিক মডেলগুলো সর্বোচ্চ ৮০% পর্যন্ত সম্পন্ন হয়।

এজেন্ট মূল্যায়ন প্রবর্তন

আপনার এজেন্টিক ওয়ার্কফ্লোতে মডেলগুলো একীভূত হলে কেমন পারফর্ম করে, সে সম্পর্কে আপনাকে আরও ভালো ধারণা দিতে, আমরা আমাদের মূল্যায়নে বহুল ব্যবহৃত এজেন্টগুলোকে যুক্ত করছি। আমরা সংশ্লিষ্ট মডেল প্রোভাইডারের এজেন্ট ব্যবহার করে LHT-এর বিপরীতে নতুন মডেলগুলো চালিয়ে শুরু করছি। উদাহরণস্বরূপ, আমরা Codex-এ GPT 5.6 Sol এবং Google Antigravity-তে Gemini 3.8 Flash চালিয়েছি। এই যুগলবন্দী দেখায় যে কীভাবে হারনেস ডিজাইন ডেভেলপারদের ফলাফলের উপর ইতিবাচক প্রভাব ফেলে, কারণ আমরা দেখেছি যে প্রম্পট ক্যাশিং এবং কম্প্যাক্ট টুল উইন্ডোয়িং টোকেন হ্রাস করতে পারে।

ভবিষ্যতে আমরা বিভিন্ন মডেল ও এজেন্ট সমন্বয়ের ফলাফলও তুলে ধরে এটিকে আরও প্রসারিত করব, যাতে আপনি ও আপনার দলের জন্য কোন সমন্বয়গুলো সবচেয়ে ভালো কাজ করে তা খুঁজে বের করতে পারেন।

আমরা এই পরিমাপে বিনিয়োগ করি, কারণ অ্যান্ড্রয়েড ডেভেলপমেন্টের জন্য আপনার পছন্দের এজেন্ট ও মডেল ব্যবহার করতে পারাটা জরুরি, এবং আগামী সপ্তাহগুলোতে আমরা আপনাকে এ বিষয়ে আরও বিস্তারিত জানাব।

নতুন মডেল যোগ করা হয়েছে

এছাড়াও, আপনার ডেভেলপমেন্ট সংক্রান্ত সিদ্ধান্তগুলোর জন্য যাতে আপনার কাছে সবচেয়ে হালনাগাদ তথ্য থাকে, তা নিশ্চিত করতে আমরা আমাদের লিডারবোর্ড প্রসারিত করে চলেছি। আমরা Gemini 3.8 Flash, Gemini 3.7 Flash, OpenAI-এর GPT-6, Anthropic-এর Fable 5.1, Kimi K3, এবং Qwen 3.8 Max যুক্ত করেছি, যার মধ্যে OpenAI-এর GPT-6 Astra ২৮% পাস রেট নিয়ে শীর্ষে রয়েছে

ভবিষ্যতের দিকে তাকিয়ে

অ্যান্ড্রয়েড বেঞ্চ ২.০ অ্যান্ড্রয়েড ডেভেলপমেন্টের জন্য এআই পরিমাপের একটি শক্তিশালী পরিবেশ প্রদান করে। দীর্ঘমেয়াদী কাজ, মাল্টিমোডাল মূল্যায়ন, এজেন্ট এবং নিরবচ্ছিন্ন স্কোরিং-এর সমন্বয়ের মাধ্যমে আমরা এআই গবেষণা দলগুলোকে আরও সক্ষম ও নির্ভরযোগ্য এআই কোডিং পার্টনার তৈরি করতে এবং এআই ডেভেলপমেন্টের জন্য আপনাদের বিকল্পগুলো সম্পর্কে আরও স্বচ্ছতা প্রদান করতে সক্ষম হব বলে আশা করি।

আপডেট করা পদ্ধতির সাথে আপডেট করা লিডারবোর্ডটি দেখে নিন। আপনার মতামত সরাসরি আমাদের অ্যান্ড্রয়েড বেঞ্চের উন্নয়নে প্রভাব ফেলে, তাই অনুগ্রহ করে GitHub- এ এবং আমাদের XLinkedIn-এর মতো সোশ্যাল চ্যানেলগুলিতে আপনার মতামত জানাতে থাকুন।

লিখেছেন:
পড়তে থাকুন