Google తన Gemini ఆడియో మోడల్ను కొత్తగా అప్డేట్ చేసింది. ఇందులో భాగంగా కొత్తగా Gemini 3.5 ట్రాన్స్క్రైబ్ అనే ఫీచర్ను అందుబాటులోకి తెచ్చింది. ఇది మునుపటి Chirp 3 మోడల్ కంటే మెరుగైన పనితీరును కనబరుస్తుందని, ముఖ్యంగా బహుభాషా సామర్థ్యం మరియు పదాల దోష రేటు విషయంలో ఇది పెద్ద పురోగతి అని Google పేర్కొంది.
ఈ కొత్త మోడల్ వినియోగదారుల వాయిస్ను బట్టి వచనాన్ని సహజంగా సవరించగలదు. రికార్డింగ్లలోని 'ఉమ్', 'ఉహ్' వంటి అనవసరమైన పూరక పదాలను ఇది స్వయంచాలకంగా తొలగిస్తుంది. అలాగే, వినియోగదారులు తమకు కావాల్సిన ప్రత్యేక పదజాలాన్ని మోడల్కు అందించడం ద్వారా, ఆ పదాల స్పెల్లింగ్ను మాన్యువల్గా సరిదిద్దాల్సిన అవసరం లేకుండా ఇది చూసుకుంటుంది.
Gemini 3.5 ట్రాన్స్క్రైబ్ వర్డ్-లెవల్ టైమ్స్టాంప్లను కూడా అందిస్తుంది. అంటే, ఆడియోలో ఏ పదం ఏ సమయంలో పలికారో ఖచ్చితంగా గుర్తించగలదు. అంతేకాదు, ముందే రికార్డ్ చేసిన ఆడియోలో గరిష్టంగా ముగ్గురు వ్యక్తులు మాట్లాడుతుంటే, వారిని వేర్వేరుగా గుర్తించి ప్రసంగాన్ని ఆపాదించే సామర్థ్యం కూడా దీనికి ఉంది.
ప్రస్తుతం ఈ ఫీచర్ మాకోస్ (macOS) Gemini యాప్ వినియోగదారులందరికీ అందుబాటులో ఉంది. ఆండ్రాయిడ్ ఫోన్లలో ఎంపిక చేసిన దేశాలు మరియు భాషలలో రాంబ్లర్ డిక్టేషన్ (Rambler Dictation) ఫీచర్ ద్వారా ఇది అందుబాటులోకి వస్తుంది. డెవలపర్లు AI స్టూడియో మరియు యాంటీగ్రావిటీ (Antigravity) ద్వారా Gemini APIలో దీనిని పరీక్షించవచ్చు. క్రోమ్ బ్రౌజర్లో కూడా ఈ సదుపాయం త్వరలోనే రానుంది.
మరోవైపు, Gemini 3.5 లైవ్ మరియు 3.5 లైవ్ ఎక్స్పెరిమెంటల్ అనే అదనపు మోడళ్లను కూడా Google ప్రకటించింది. అయితే, ఈ కథనం ప్రచురణ సమయానికి ఇవి ఇంకా ప్రారంభం కాలేదు. అలాగే, చాలా కాలంగా ఎదురుచూస్తున్న Gemini 3.5 ప్రో మోడల్ విడుదలపై కూడా Google ఇంకా స్పష్టమైన తేదీని ప్రకటించలేదు.








